Angolo di Anderson
La verbosità diminuisce l’accuratezza nei grandi modelli linguistici

Una nuova ricerca scopre che costringere i grandi modelli linguistici a fornire risposte piÃđ brevi migliora notevolmente lâaccuratezza e la qualità delle loro risposte.
Â
Chiunque abbia cercato di fermare un chatbot che âchiacchieraâ riconoscerà le conclusioni di questa nuova ricerca: costringere lâAI a fornire risposte piÃđ brevi la rende piÃđ precisa.
Investigando i motivi per cui i chatbot piÃđ grandi performano peggio in questo senso rispetto a quelli piÃđ piccoli, in alcuni casi (noti come inverse scaling), la ricerca ha scoperto che costringere 31 popolari grandi modelli linguistici (LLM) a fornire risposte piÃđ brevi ha causato un miglioramento dellâaccuratezza delle loro risposte fino al 26,3%:
âI risultati forniscono prove causali convincenti: le restrizioni di brevità hanno migliorato lâaccuratezza dei grandi modelli del 26,3% e hanno ridotto il divario di inverse scaling del 67% (dal 44,2% al 14,8%, test t appaiato: t = 7,80, p < 0,0001).'
La verbosità eccessiva ÃĻ una lamentela frequente tra gli utenti finali, non solo tra coloro che utilizzano modelli commerciali come ChatGPT, dove i forum di supporto presentano questo argomento frequentemente.
Il dominio piÃđ colpito dalla riduzione della verbosità nelle risposte ÃĻ la matematica, dove gli AI testati sono stati costretti a rispondere in 50 parole o meno. Per le attività di comprensione della lettura, sono stati limitati a sole 10 parole nelle loro risposte.
La ricerca conclude che non câÃĻ nulla di architettonico che debba essere affrontato per applicare questa soluzione in modo sistematico. Tuttavia, in una sessione di chat dellâutente, una direttiva verso la brevità dovrebbe essere probabilmente ripetuta, mentre un prompt di sistema applicato a livello globale â che dovrebbe essere implementato come impostazione predefinita su piattaforme come ChatGPT â potrebbe rendere le risposte piÃđ brevi il comportamento predefinito.
Il nuovo articolo si intitola Le restrizioni di brevità invertite le gerarchie delle prestazioni nei modelli linguistici e proviene dal Dipartimento di Informatica dellâIstituto Politecnico di Svezia a Chattogram, in Bangladesh.
Venti impetuosi
Nessuno di questo spiega esattamente perchÃĐ i modelli piÃđ grandi tendono alla verbosità , poichÃĐ questo ÃĻ qualcosa che colpisce anche i modelli open source. La ricerca suggerisce che i protocolli e le pratiche comuni nellâapprendimento per rinforzo da feedback umano (RLHF) potrebbero offrire una spiegazione*:
âUnâorigine plausibile ÃĻ lâaddestramento di allineamento RLHF, dove gli annotatori umani premiano la completezza in modo sproporzionato nei modelli piÃđ grandi con una maggiore capacità di agire sui segnali di lunghezza â coerente con le differenze di verbosità piÃđ grandi nei varianti del modello istruito rispetto al modello di base.
âLavori precedenti documentano un bias di lunghezza sistematico nei modelli di reward, dove gli annotatori confondono la lunghezza con la qualità .
âI modelli piÃđ grandi, avendo una maggiore capacità di soddisfare i segnali di lunghezza, possono internalizzare la generazione verbosa piÃđ profondamente dei modelli piÃđ piccoli, producendo il sovrappensiero dipendente dalla scala che osserviamo.â
Negli esseri umani, la verbosità puÃē verificarsi per colmare un silenzio, o per mascherare sentimenti di imbarazzo, a causa di malattie mentali, o per nascondere una mancanza di conoscenza. In effetti, un AI potrebbe essere influenzato da questi fattori solo attraverso lâassorbimento di dati di training che riflettono/manifestano questi tratti.
In dataset corpora, esistono altre motivazioni per risposte prolisse, come lâincentivo SEO per produrre contenuti testuali piÃđ lunghi, ad esempio in post di ricette, in cui la lunghezza diventa (spesso erroneamente) associata allâautorità .
Cosa non puÃē essere completamente escluso ÃĻ che le piattaforme basate su API, incentivizzate a spingere gli utenti verso un livello di abbonamento piÃđ alto e piÃđ costoso, incoraggino o non supervisionino la verbosità , poichÃĐ aumenta lâutilizzo dei token in modo molto economico, senza la necessità di un eccessivo ragionamento o chiamate RAGâ .
La nuova ricerca ÃĻ intitolata Le restrizioni di brevità invertite le gerarchie delle prestazioni nei modelli linguistici e proviene dal Dipartimento di Informatica dellâIstituto Politecnico di Svezia a Chattogram, in Bangladesh.
Metodo
Per testare le teorie del paper, 31 modelli linguistici sono stati valutati â troppi per essere elencati in forma testuale qui, ma rappresentati nellâimmagine in basso:

I grandi modelli linguistici (LLM) testati in varie parti dei test per il nuovo paper.
I modelli sono stati valutati contro cinque raccolte di benchmark: GSM8K, per il ragionamento matematico; BoolQ, per la comprensione della lettura; CommonsenseQA, per il ragionamento basato sul senso comune; ARC-Easy, che copre le domande scientifiche; e MMLU-STEM, anchâesso per la conoscenza scientifica.
Le risposte sono state generate utilizzando greedy decoding per assicurare output deterministici, quindi estratte con regole specifiche del compito, con lâaccuratezza misurata come la quota di risposte corrette rispetto alla verità di base.
I modelli sono stati divisi per dimensione, con quelli al di sotto dei 10 miliardi di parametri trattati come âpiccoliâ e quelli sopra i 70 miliardi come âgrandiâ, in base ai gap di prestazioni osservati.
Lâinversione della scala ÃĻ stata quantificata confrontando le prestazioni di questi gruppi in ogni problema, segnando i casi in cui i modelli piÃđ piccoli hanno superato quelli piÃđ grandi; la dimensione dellâeffetto statistico ÃĻ stata utilizzata per confermare che questi gap riflettevano differenze significative e coerenti, piuttosto che rumore.
Escludendo la possibilità di richiamo
Per escludere la possibilità che i modelli stessero semplicemente richiamando i dati di training, sono stati eseguiti tre controlli separati, esaminando quanto variavano le risposte; quanto fluttuava la loro lunghezza; e come venivano commessi gli errori. Se i modelli si basavano su pattern memorizzati, le risposte tendevano a ripetersi o a seguire modelli fissi; invece, le risposte si sono rivelate per lo piÃđ uniche tra i modelli, con variazioni notevoli nella lunghezza, da una risposta allâaltra.
Gli errori sono stati ispezionati direttamente, con la maggior parte dei fallimenti che assumevano la forma di lunghe spiegazioni errate, piuttosto che risposte brevi ed evasive â indicando che i modelli stavano generando un ragionamento reale, piuttosto che recuperando risposte archiviate.
Dati e test
Testando le domande individuali piuttosto che i punteggi di riepilogo, una grande parte delle attività di benchmark si ÃĻ rivelata non informativa, con il 27,1% che non ÃĻ riuscita a separare i modelli in alcun modo, poichÃĐ ogni sistema ÃĻ riuscito o ogni sistema ha fallito, lasciando nessun segnale reale sulla prestazione relativa:

La suddivisione a livello di problema attraverso cinque benchmark ha mostrato che una parte sostanziale delle attività non ÃĻ riuscita a distinguere tra i modelli, mentre una parte piÃđ piccola ma coerente ha esibito unâinversione della scala, dove i modelli piÃđ piccoli hanno superato quelli piÃđ grandi. La distribuzione complessiva su 1.485 problemi indica che il 7,7% esibisce unâinversione della scala. Fonte
Tra le domande che hanno differenziato i modelli, la maggior parte si ÃĻ comportata come previsto, con i sistemi piÃđ grandi che hanno performato meglio, ma un gruppo piÃđ piccolo ha mostrato il modello opposto, con i modelli piÃđ piccoli che sono usciti vincitori. In tutti i problemi, lâinversione della scala ÃĻ apparsa nel 7,7% dei casi, indicando che lâeffetto non ÃĻ marginale.
Emergenza dellâinversione della scala
Tra i cinque benchmark, 115 problemi sono stati trovati in cui i modelli piÃđ piccoli hanno superato quelli piÃđ grandi, rappresentando il 7,7% di tutti i 1.485 problemi, indicando che lâinversione della scala non ÃĻ unâoccorrenza rara o marginale in questo contesto.
In realtà , lâeffetto ÃĻ emerso in ogni dataset: piÃđ forte in BoolQ e piÃđ debole in CommonsenseQA, ARC-Easy, GSM8K e MMLU-STEM, indicando che ÃĻ diffuso, ma varia a seconda del compito:

Lâinversione della scala ÃĻ emersa in tutti i benchmark, variando dal 3,9% in MMLU-STEM allâ11,3% in BoolQ, con 115 problemi in totale. I gap di prestazione hanno favorito i modelli piÃđ piccoli di 28,4 punti percentuali in media. Lâaccuratezza ÃĻ diminuita allâaumentare della dimensione del modello, con i modelli piÃđ piccoli che hanno raggiunto il 66,1%, rispetto al 41,5% per i modelli piÃđ grandi.
La dimensione del gap si ÃĻ rivelata sostanziale, con i modelli piÃđ piccoli in vantaggio di 28,4 punti percentuali in media, e ogni caso ha mostrato lo stesso vantaggio, indicando una diminuzione coerente delle prestazioni, piuttosto che errori occasionali o ad hoc.
Lo stesso modello si ÃĻ verificato in diverse famiglie di modelli, tra cui Llama, Qwen, Gemma e Mistral, dove le versioni piÃđ grandi hanno performato peggio di quelle piÃđ piccole, con lâaccuratezza che tende a diminuire allâaumentare della dimensione del modello in questi problemi.
Il gap tra i modelli piÃđ piccoli e piÃđ grandi ÃĻ stato sufficientemente grande da rendere improbabile che il caso possa spiegarlo; e poichÃĐ lo stesso modello si ÃĻ verificato in diversi benchmark, compiti e famiglie di modelli, lâinversione della scala ÃĻ emersa come un effetto coerente piuttosto che casuale.
Guardando allâinterno di ogni famiglia di modelli, le versioni piÃđ grandi hanno ripetutamente performato peggio di quelle piÃđ piccole in questi problemi, suggerendo che il declino possa essere legato alla scala stessa, piuttosto che alle differenze di progettazione.
I risultati indicano anche un limite per ogni attività , in cui lâaumento della dimensione del modello inizia a danneggiare le prestazioni, mostrando che i modelli piÃđ grandi non portano sempre a risultati migliori.
Esaminando il sovrappensiero
Dopo aver stabilito che i modelli piÃđ grandi a volte performano peggio in determinati domini, lâanalisi si ÃĻ concentrata sul perchÃĐ ciÃē accade, proponendo che il problema non ÃĻ la mancanza di capacità , ma troppa spiegazione â ovvero, casi in cui le risposte piÃđ lunghe iniziano a oscurare il ragionamento corretto.
Attraverso i dati, le risposte piÃđ lunghe sono state collegate a una minore accuratezza in questi problemi difficili, anche se i modelli piÃđ grandi e piÃđ piccoli hanno prodotto un numero simile di passaggi di ragionamento, suggerendo che il problema non ÃĻ quanto ragionamento viene fatto, ma come viene espresso:

Le risposte piÃđ brevi hanno migliorato le prestazioni dei modelli piÃđ grandi e hanno ridotto il gap con i modelli piÃđ piccoli, riducendo la differenza dal 44,2% al 14,8% (e in alcuni casi invertendola completamente), mentre i formati di risposta diretti hanno ridotto ulteriormente il gap. I guadagni piÃđ forti sono apparsi in GSM8K e MMLU-STEM, dove le classifiche si sono invertite a favore dei modelli piÃđ grandi, e i controlli sulla lunghezza della risposta hanno confermato che lâintervento ha funzionato, con output che sono scesi da circa 197 token a meno di 80, collegando la riduzione della verbosità a una maggiore accuratezza.
Quando le risposte sono state costrette a essere piÃđ brevi, i modelli piÃđ grandi hanno migliorato notevolmente, riducendo notevolmente il gap di prestazione, e, in alcuni casi, quasi eliminandolo. Al contrario, i modelli piÃđ piccoli sono cambiati molto poco, indicando che la verbosità stava attivamente danneggiando i sistemi piÃđ grandi.
Lâeffetto si ÃĻ rivelato variabile a seconda del compito, con alcuni benchmark che hanno tratto vantaggio dalle risposte piÃđ brevi, e altri che hanno richiesto un certo grado di spiegazione; ma in diversi casi, la classifica tra i modelli piÃđ piccoli e piÃđ grandi si ÃĻ completamente invertita una volta che la verbosità ÃĻ stata limitata, rivelando che i modelli piÃđ grandi avevano una capacità nascosta che stava essere mascherata da unâeccessiva elaborazione.
Ulteriori analisi hanno mostrato che i modelli piÃđ grandi tendevano a produrre output piÃđ lunghi nel complesso, nonostante utilizzassero leggermente meno passaggi di ragionamento espliciti, indicando uno stile di ragionamento piÃđ diffuso e meno strutturato.
Al contrario, i modelli piÃđ piccoli hanno fornito risposte piÃđ brevi e dirette, suggerendo che il modo in cui il ragionamento viene espresso, piuttosto che la quantità di ragionamento stesso, guida il declino delle prestazioni.
Gli autori concludono in generale che le restrizioni di brevità portano benefici di accuratezza e considerano che ciÃē potrebbe diventare una caratteristica fondamentale dei modelli linguistici, piuttosto che una restrizione ripetitiva e applicata dallâutente che non sopravvive tra le sessioni; e affermano:
â[Le restrizioni di brevità ] aiutano notevolmente i modelli piÃđ grandi, mentre influenzano appena i modelli piÃđ piccoli.
âSe la verbosità fosse incidentale e non causale, ci aspetteremmo cambiamenti di accuratezza uniformi in entrambe le categorie di dimensioni. La risposta differenziale conferma che il sovrappensiero ÃĻ un modo di fallimento specifico della scala, e non un effetto di difficoltà del compito.â
Conclusione
Oltre alle versioni open source testate dai ricercatori, il problema della verbosità sembra verificarsi, anecdoticamente, con una certa frequenza in molti modelli importanti oltre a ChatGPT, tra cui Claude, Gemini e Grok.
Se queste piattaforme stanno ignorando il problema della verbosità perchÃĐ aumenta lâutilizzo dei token e incoraggia una spesa piÃđ altaâ , non sembra ragionevole che accetterebbero il calo di accuratezza che accompagna questo âincentivoâ.
Sarebbe interessante vedere se un metodo empirico potrebbe determinare con certezza da dove proviene la tendenza alla verbosità . Chiunque abbia mai cercato di far parlare un chatbot, piuttosto che farlo âbloggingâ con risposte verbali e multistep, si sarà reso conto che il modello ÃĻ stato gravemente impresso con âguide completeâ e âsoluzioni accettateâ nei suoi dati di training.
Sarebbe quindi molto interessante vedere se un modello specificamente addestrato su conversazioni passo dopo passo potrebbe effettivamente allontanarsi dalla tendenza verbosa e riassuntiva. Tuttavia, sembra probabile che alcune restrizioni o filtri dovrebbero essere applicati al peso che il modello ÃĻ addestrato a dare sulla ârisposta decisaâ, in modo che si addestri direttamente anche sul materiale precedente â essenzialmente, il ragionamento esplicito nelle conversazioni a turni.
Dal momento che i dati appropriati di questo tipo sembrano essere rari, forse lâunico modo per procedere con questo approccio sarebbe attraverso dati sintetici, in cui le conclusioni finali âcomplesseâ vengono analizzate conversationalmente â ironicamente, nello stesso modo in cui lâAI di Google NotebookLM puÃē interpretare i podcast dallâinput testuale semplice.
Â
* La mia conversione delle citazioni in linea degli autori in collegamenti ipertestuali.
â Ma siamo onesti, il divario tra i costi reali di fornitura dellâAI e le tariffe di abbonamento ÃĻ attualmente cosÃŽ grande che ciÃē danneggerebbe solo la reputazione della base degli utenti senza risolvere la grave economia sottostante di questa fase della âconversioneâ e âconvergenzaâ dellâAI.
Pubblicato per la prima volta domenica 5 aprile 2026












