Angolo di Anderson

La verbosità diminuisce l’accuratezza nei grandi modelli linguistici

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
AI-generated image of a man literally up to his neck in printed verbiage. GPT-1.5.

Una nuova ricerca scopre che costringere i grandi modelli linguistici a fornire risposte più brevi migliora notevolmente l’accuratezza e la qualità delle loro risposte.

 

Chiunque abbia cercato di fermare un chatbot che “chiacchiera” riconoscerà le conclusioni di questa nuova ricerca: costringere l’AI a fornire risposte più brevi la rende più precisa.

Investigando i motivi per cui i chatbot più grandi performano peggio in questo senso rispetto a quelli più piccoli, in alcuni casi (noti come inverse scaling), la ricerca ha scoperto che costringere 31 popolari grandi modelli linguistici (LLM) a fornire risposte più brevi ha causato un miglioramento dell’accuratezza delle loro risposte fino al 26,3%:

‘I risultati forniscono prove causali convincenti: le restrizioni di brevità hanno migliorato l’accuratezza dei grandi modelli del 26,3% e hanno ridotto il divario di inverse scaling del 67% (dal 44,2% al 14,8%, test t appaiato: t = 7,80, p < 0,0001).'

La verbosità eccessiva è una lamentela frequente tra gli utenti finali, non solo tra coloro che utilizzano modelli commerciali come ChatGPT, dove i forum di supporto presentano questo argomento frequentemente.

Il dominio più colpito dalla riduzione della verbosità nelle risposte è la matematica, dove gli AI testati sono stati costretti a rispondere in 50 parole o meno. Per le attività di comprensione della lettura, sono stati limitati a sole 10 parole nelle loro risposte.

La ricerca conclude che non c’è nulla di architettonico che debba essere affrontato per applicare questa soluzione in modo sistematico. Tuttavia, in una sessione di chat dell’utente, una direttiva verso la brevità dovrebbe essere probabilmente ripetuta, mentre un prompt di sistema applicato a livello globale – che dovrebbe essere implementato come impostazione predefinita su piattaforme come ChatGPT – potrebbe rendere le risposte più brevi il comportamento predefinito.

Il nuovo articolo si intitola Le restrizioni di brevità invertite le gerarchie delle prestazioni nei modelli linguistici e proviene dal Dipartimento di Informatica dell’Istituto Politecnico di Svezia a Chattogram, in Bangladesh.

Venti impetuosi

Nessuno di questo spiega esattamente perché i modelli più grandi tendono alla verbosità, poiché questo è qualcosa che colpisce anche i modelli open source. La ricerca suggerisce che i protocolli e le pratiche comuni nell’apprendimento per rinforzo da feedback umano (RLHF) potrebbero offrire una spiegazione*:

‘Un’origine plausibile è l’addestramento di allineamento RLHF, dove gli annotatori umani premiano la completezza in modo sproporzionato nei modelli più grandi con una maggiore capacità di agire sui segnali di lunghezza – coerente con le differenze di verbosità più grandi nei varianti del modello istruito rispetto al modello di base.

‘Lavori precedenti documentano un bias di lunghezza sistematico nei modelli di reward, dove gli annotatori confondono la lunghezza con la qualità.

‘I modelli più grandi, avendo una maggiore capacità di soddisfare i segnali di lunghezza, possono internalizzare la generazione verbosa più profondamente dei modelli più piccoli, producendo il sovrappensiero dipendente dalla scala che osserviamo.’

Negli esseri umani, la verbosità può verificarsi per colmare un silenzio, o per mascherare sentimenti di imbarazzo, a causa di malattie mentali, o per nascondere una mancanza di conoscenza. In effetti, un AI potrebbe essere influenzato da questi fattori solo attraverso l’assorbimento di dati di training che riflettono/manifestano questi tratti.

In dataset corpora, esistono altre motivazioni per risposte prolisse, come l’incentivo SEO per produrre contenuti testuali più lunghi, ad esempio in post di ricette, in cui la lunghezza diventa (spesso erroneamente) associata all’autorità.

Cosa non può essere completamente escluso è che le piattaforme basate su API, incentivizzate a spingere gli utenti verso un livello di abbonamento più alto e più costoso, incoraggino o non supervisionino la verbosità, poiché aumenta l’utilizzo dei token in modo molto economico, senza la necessità di un eccessivo ragionamento o chiamate RAG.

La nuova ricerca è intitolata Le restrizioni di brevità invertite le gerarchie delle prestazioni nei modelli linguistici e proviene dal Dipartimento di Informatica dell’Istituto Politecnico di Svezia a Chattogram, in Bangladesh.

Metodo

Per testare le teorie del paper, 31 modelli linguistici sono stati valutati – troppi per essere elencati in forma testuale qui, ma rappresentati nell’immagine in basso:

I grandi modelli linguistici (LLM) testati in varie parti dei test per il nuovo paper.

I grandi modelli linguistici (LLM) testati in varie parti dei test per il nuovo paper.

I modelli sono stati valutati contro cinque raccolte di benchmark: GSM8K, per il ragionamento matematico; BoolQ, per la comprensione della lettura; CommonsenseQA, per il ragionamento basato sul senso comune; ARC-Easy, che copre le domande scientifiche; e MMLU-STEM, anch’esso per la conoscenza scientifica.

Le risposte sono state generate utilizzando greedy decoding per assicurare output deterministici, quindi estratte con regole specifiche del compito, con l’accuratezza misurata come la quota di risposte corrette rispetto alla verità di base.

I modelli sono stati divisi per dimensione, con quelli al di sotto dei 10 miliardi di parametri trattati come “piccoli” e quelli sopra i 70 miliardi come “grandi”, in base ai gap di prestazioni osservati.

L’inversione della scala è stata quantificata confrontando le prestazioni di questi gruppi in ogni problema, segnando i casi in cui i modelli più piccoli hanno superato quelli più grandi; la dimensione dell’effetto statistico è stata utilizzata per confermare che questi gap riflettevano differenze significative e coerenti, piuttosto che rumore.

Escludendo la possibilità di richiamo

Per escludere la possibilità che i modelli stessero semplicemente richiamando i dati di training, sono stati eseguiti tre controlli separati, esaminando quanto variavano le risposte; quanto fluttuava la loro lunghezza; e come venivano commessi gli errori. Se i modelli si basavano su pattern memorizzati, le risposte tendevano a ripetersi o a seguire modelli fissi; invece, le risposte si sono rivelate per lo più uniche tra i modelli, con variazioni notevoli nella lunghezza, da una risposta all’altra.

Gli errori sono stati ispezionati direttamente, con la maggior parte dei fallimenti che assumevano la forma di lunghe spiegazioni errate, piuttosto che risposte brevi ed evasive – indicando che i modelli stavano generando un ragionamento reale, piuttosto che recuperando risposte archiviate.

Dati e test

Testando le domande individuali piuttosto che i punteggi di riepilogo, una grande parte delle attività di benchmark si è rivelata non informativa, con il 27,1% che non è riuscita a separare i modelli in alcun modo, poiché ogni sistema è riuscito o ogni sistema ha fallito, lasciando nessun segnale reale sulla prestazione relativa:

La suddivisione a livello di problema attraverso cinque benchmark ha mostrato che una parte sostanziale delle attività non è riuscita a distinguere tra i modelli, mentre una parte più piccola ma coerente ha esibito un'inversione della scala, dove i modelli più piccoli hanno superato quelli più grandi. La distribuzione complessiva su 1.485 problemi indica che il 7,7% esibisce un'inversione della scala.

La suddivisione a livello di problema attraverso cinque benchmark ha mostrato che una parte sostanziale delle attività non è riuscita a distinguere tra i modelli, mentre una parte più piccola ma coerente ha esibito un’inversione della scala, dove i modelli più piccoli hanno superato quelli più grandi. La distribuzione complessiva su 1.485 problemi indica che il 7,7% esibisce un’inversione della scala. Fonte

Tra le domande che hanno differenziato i modelli, la maggior parte si è comportata come previsto, con i sistemi più grandi che hanno performato meglio, ma un gruppo più piccolo ha mostrato il modello opposto, con i modelli più piccoli che sono usciti vincitori. In tutti i problemi, l’inversione della scala è apparsa nel 7,7% dei casi, indicando che l’effetto non è marginale.

Emergenza dell’inversione della scala

Tra i cinque benchmark, 115 problemi sono stati trovati in cui i modelli più piccoli hanno superato quelli più grandi, rappresentando il 7,7% di tutti i 1.485 problemi, indicando che l’inversione della scala non è un’occorrenza rara o marginale in questo contesto.

In realtà, l’effetto è emerso in ogni dataset: più forte in BoolQ e più debole in CommonsenseQA, ARC-Easy, GSM8K e MMLU-STEM, indicando che è diffuso, ma varia a seconda del compito:

L'inversione della scala è emersa in tutti i benchmark, variando dal 3,9% in MMLU-STEM all'11,3% in BoolQ, con 115 problemi in totale. I gap di prestazione hanno favorito i modelli più piccoli di 28,4 punti percentuali in media. L'accuratezza è diminuita all'aumentare della dimensione del modello, con i modelli più piccoli che hanno raggiunto il 66,1%, rispetto al 41,5% per i modelli più grandi.

L’inversione della scala è emersa in tutti i benchmark, variando dal 3,9% in MMLU-STEM all’11,3% in BoolQ, con 115 problemi in totale. I gap di prestazione hanno favorito i modelli più piccoli di 28,4 punti percentuali in media. L’accuratezza è diminuita all’aumentare della dimensione del modello, con i modelli più piccoli che hanno raggiunto il 66,1%, rispetto al 41,5% per i modelli più grandi.

La dimensione del gap si è rivelata sostanziale, con i modelli più piccoli in vantaggio di 28,4 punti percentuali in media, e ogni caso ha mostrato lo stesso vantaggio, indicando una diminuzione coerente delle prestazioni, piuttosto che errori occasionali o ad hoc.

Lo stesso modello si è verificato in diverse famiglie di modelli, tra cui Llama, Qwen, Gemma e Mistral, dove le versioni più grandi hanno performato peggio di quelle più piccole, con l’accuratezza che tende a diminuire all’aumentare della dimensione del modello in questi problemi.

Il gap tra i modelli più piccoli e più grandi è stato sufficientemente grande da rendere improbabile che il caso possa spiegarlo; e poiché lo stesso modello si è verificato in diversi benchmark, compiti e famiglie di modelli, l’inversione della scala è emersa come un effetto coerente piuttosto che casuale.

Guardando all’interno di ogni famiglia di modelli, le versioni più grandi hanno ripetutamente performato peggio di quelle più piccole in questi problemi, suggerendo che il declino possa essere legato alla scala stessa, piuttosto che alle differenze di progettazione.

I risultati indicano anche un limite per ogni attività, in cui l’aumento della dimensione del modello inizia a danneggiare le prestazioni, mostrando che i modelli più grandi non portano sempre a risultati migliori.

Esaminando il sovrappensiero

Dopo aver stabilito che i modelli più grandi a volte performano peggio in determinati domini, l’analisi si è concentrata sul perché ciò accade, proponendo che il problema non è la mancanza di capacità, ma troppa spiegazione – ovvero, casi in cui le risposte più lunghe iniziano a oscurare il ragionamento corretto.

Attraverso i dati, le risposte più lunghe sono state collegate a una minore accuratezza in questi problemi difficili, anche se i modelli più grandi e più piccoli hanno prodotto un numero simile di passaggi di ragionamento, suggerendo che il problema non è quanto ragionamento viene fatto, ma come viene espresso:

Le risposte più brevi hanno migliorato le prestazioni dei modelli più grandi e hanno ridotto il gap con i modelli più piccoli, riducendo la differenza dal 44,2% al 14,8% (e in alcuni casi invertendola completamente), mentre i formati di risposta diretti hanno ridotto ulteriormente il gap. I guadagni più forti sono apparsi in GSM8K e MMLU-STEM, dove le classifiche si sono invertite a favore dei modelli più grandi, e i controlli sulla lunghezza della risposta hanno confermato che l'intervento ha funzionato, con output che sono scesi da circa 197 token a meno di 80, collegando la riduzione della verbosità a una maggiore accuratezza.

Le risposte più brevi hanno migliorato le prestazioni dei modelli più grandi e hanno ridotto il gap con i modelli più piccoli, riducendo la differenza dal 44,2% al 14,8% (e in alcuni casi invertendola completamente), mentre i formati di risposta diretti hanno ridotto ulteriormente il gap. I guadagni più forti sono apparsi in GSM8K e MMLU-STEM, dove le classifiche si sono invertite a favore dei modelli più grandi, e i controlli sulla lunghezza della risposta hanno confermato che l’intervento ha funzionato, con output che sono scesi da circa 197 token a meno di 80, collegando la riduzione della verbosità a una maggiore accuratezza.

Quando le risposte sono state costrette a essere più brevi, i modelli più grandi hanno migliorato notevolmente, riducendo notevolmente il gap di prestazione, e, in alcuni casi, quasi eliminandolo. Al contrario, i modelli più piccoli sono cambiati molto poco, indicando che la verbosità stava attivamente danneggiando i sistemi più grandi.

L’effetto si è rivelato variabile a seconda del compito, con alcuni benchmark che hanno tratto vantaggio dalle risposte più brevi, e altri che hanno richiesto un certo grado di spiegazione; ma in diversi casi, la classifica tra i modelli più piccoli e più grandi si è completamente invertita una volta che la verbosità è stata limitata, rivelando che i modelli più grandi avevano una capacità nascosta che stava essere mascherata da un’eccessiva elaborazione.

Ulteriori analisi hanno mostrato che i modelli più grandi tendevano a produrre output più lunghi nel complesso, nonostante utilizzassero leggermente meno passaggi di ragionamento espliciti, indicando uno stile di ragionamento più diffuso e meno strutturato.

Al contrario, i modelli più piccoli hanno fornito risposte più brevi e dirette, suggerendo che il modo in cui il ragionamento viene espresso, piuttosto che la quantità di ragionamento stesso, guida il declino delle prestazioni.

Gli autori concludono in generale che le restrizioni di brevità portano benefici di accuratezza e considerano che ciò potrebbe diventare una caratteristica fondamentale dei modelli linguistici, piuttosto che una restrizione ripetitiva e applicata dall’utente che non sopravvive tra le sessioni; e affermano:

‘[Le restrizioni di brevità] aiutano notevolmente i modelli più grandi, mentre influenzano appena i modelli più piccoli.

‘Se la verbosità fosse incidentale e non causale, ci aspetteremmo cambiamenti di accuratezza uniformi in entrambe le categorie di dimensioni. La risposta differenziale conferma che il sovrappensiero è un modo di fallimento specifico della scala, e non un effetto di difficoltà del compito.’

Conclusione

Oltre alle versioni open source testate dai ricercatori, il problema della verbosità sembra verificarsi, anecdoticamente, con una certa frequenza in molti modelli importanti oltre a ChatGPT, tra cui Claude, Gemini e Grok.

Se queste piattaforme stanno ignorando il problema della verbosità perché aumenta l’utilizzo dei token e incoraggia una spesa più alta, non sembra ragionevole che accetterebbero il calo di accuratezza che accompagna questo ‘incentivo’.

Sarebbe interessante vedere se un metodo empirico potrebbe determinare con certezza da dove proviene la tendenza alla verbosità. Chiunque abbia mai cercato di far parlare un chatbot, piuttosto che farlo ‘blogging’ con risposte verbali e multistep, si sarà reso conto che il modello è stato gravemente impresso con ‘guide complete’ e ‘soluzioni accettate’ nei suoi dati di training.

Sarebbe quindi molto interessante vedere se un modello specificamente addestrato su conversazioni passo dopo passo potrebbe effettivamente allontanarsi dalla tendenza verbosa e riassuntiva. Tuttavia, sembra probabile che alcune restrizioni o filtri dovrebbero essere applicati al peso che il modello è addestrato a dare sulla ‘risposta decisa’, in modo che si addestri direttamente anche sul materiale precedente – essenzialmente, il ragionamento esplicito nelle conversazioni a turni.

Dal momento che i dati appropriati di questo tipo sembrano essere rari, forse l’unico modo per procedere con questo approccio sarebbe attraverso dati sintetici, in cui le conclusioni finali ‘complesse’ vengono analizzate conversationalmente – ironicamente, nello stesso modo in cui l’AI di Google NotebookLM può interpretare i podcast dall’input testuale semplice.

 

* La mia conversione delle citazioni in linea degli autori in collegamenti ipertestuali.

Ma siamo onesti, il divario tra i costi reali di fornitura dell’AI e le tariffe di abbonamento è attualmente così grande che ciò danneggerebbe solo la reputazione della base degli utenti senza risolvere la grave economia sottostante di questa fase della ‘conversione’ e ‘convergenza’ dell’AI.

Pubblicato per la prima volta domenica 5 aprile 2026

Scrittore di apprendimento automatico, specialista nel dominio della sintesi di immagini umane. Ex capo del contenuto di ricerca presso Metaphysic.ai, fino alla sua dissoluzione in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai