Accanto alla corsa ai modelli sempre più grandi si è consolidata una tendenza opposta e altrettanto significativa: l uso di modelli linguistici compatti, capaci di girare su un server aziendale, su una workstation o addirittura sul dispositivo dell utente. Per una quota crescente di compiti reali la differenza di qualità rispetto ai modelli di frontiera è marginale, mentre le differenze di costo, latenza e riservatezza sono sostanziali.
I compiti in cui i modelli piccoli bastano
Classificazione di documenti e ticket, estrazione di campi strutturati da fatture e contratti, normalizzazione di anagrafiche, riformulazione di testi brevi, ricerca semantica interna: sono attività ripetitive, con un formato di output ben definito, in cui un modello compatto correttamente istruito raggiunge livelli di affidabilità adeguati e a costo per operazione molto inferiore.
Perché la latenza e il perimetro contano
Nei processi interattivi, dal supporto in negozio alla diagnostica di campo, un secondo di attesa in più cambia l esperienza. Eseguire l inferenza in locale elimina la dipendenza dalla connettività e mantiene i dati dentro il perimetro aziendale, semplificando la valutazione di impatto e i rapporti con i responsabili della protezione dei dati.
Il costo si sposta sull ingegneria
L architettura in locale non è gratuita: richiede competenze di ottimizzazione, gestione delle versioni dei modelli, monitoraggio della qualità delle risposte e un ciclo di aggiornamento. La scelta ragionevole per molte organizzazioni è ibrida: modelli compatti in locale per i compiti ad alto volume e ben definiti, modelli di frontiera via API per i casi complessi e a bassa frequenza.
















