Unghiul lui Anderson
Scăderea verbositàții crește acuratețea în modelele de limbaj mare

Noi cercetări arată că forțarea modelelor de limbaj mare să ofere răspunsuri mai scurte îmbunătățește semnificativ acuratețea și calitatea răspunsurilor lor.
Oricine a încercat să oprească un chatbot să “vorbească mult” va recunoaște concluziile noilor cercetări: forțarea inteligenței artificiale să ofere răspunsuri mai scurte o face mai precisă.
Investigând motivele pentru care modelele de inteligență artificială mai mari funcționează mai prost în acest sens decât cele mai mici, în anumite cazuri (cunoscute sub numele de scalare inversă), cercetarea a constatat că forțarea a 31 de modele de limbaj mare populare să ofere răspunsuri mai scurte a determinat o îmbunătățire de până la 26,3% a acurateței răspunsurilor lor:
‘Rezultatele oferă dovezi cauzale convingătoare: constrângerile de concizie au îmbunătățit acuratețea modelului mare cu 26,3 puncte procentuale și au redus decalajul de scalare inversă cu 67% (de la 44,2% la 14,8%, test t pereche: t = 7,80, p < 0,0001).'
Verbositatea excesivă este o plângere frecventă printre utilizatori, nu numai printre cei care folosesc modele comerciale, cum ar fi ChatGPT, unde forumurile de suport prezintă această temă frecvent.
Domnul cel mai afectat de remedierea verbositàții în răspunsuri este matematica, unde inteligențele artificiale testate au fost limitate să răspundă în 50 de cuvinte sau mai puțin. Pentru înțelegerea citirii sarcinilor, au fost restricționate la un singur cuvânt în răspunsurile lor.
Articolul definește tendința inteligenței artificiale de a fi verbosă ca gândire excesivă, în care mesajul central nu este doar ascuns de verbi, ci uneori afectat negativ de acesta. Cu cât modelul este mai mic, observă articolul, cu atât mai puțin este nevoie de această soluție, sau funcționează.
Cercetarea concluzionează că nu există nimic arhitectural care trebuie abordat pentru a aplica această soluție în mod sistematic. Cu toate acestea, într-o sesiune de chat a unui utilizator, o directivă către concizie ar trebui să fie repetată, în timp ce un prompt de sistem aplicat la nivel global – care ar trebui implementat ca o setare implicită pe platforme precum ChatGPT – ar putea face răspunsurile mai scurte să devină comportamentul implicit.
Vânturi puternice
Nimic din acestea nu explică exact de ce modelele mai mari tind să fie verbos, deoarece acest lucru afectează și modelele open source. Articolul sugerează că protocoalele și practicile comune în tehnici de învățare prin întărire din feedbackul uman (RLHF) ar putea oferi o explicație*:
‘O origine plauzibilă este antrenamentul de aliniere RLHF, în care annotatorii umani răsplătesc exhaustivitatea disproporționat în modelele mai mari cu o capacitate mai mare de a acționa asupra semnalelor de lungime – consistent cu diferențele de verbositate care sunt mai mari în variantele de model instruite decât în cele de bază.
‘Lucrările anterioare documentează o părtinire sistematică a lungimii în modelele de recompensă, unde annotatorii confundă lungimea cu calitatea.
‘Modelele mai mari, având o capacitate mai mare de a satisface semnalele de recompensă pentru lungime, pot internaliza generarea verbos mai profund decât modelele mai mici, producând gândirea excesivă dependentă de scară pe care o observăm.’
La oameni, verbositatea poate apărea pentru a umple o tăcere, sau pentru a masca sentimente de jenă, din cauza bolilor mintale, sau pentru a ascunde lipsa de cunoștințe. În efect, o inteligență artificială ar putea fi influențată de aceste factori doar prin absorbția datelor de antrenament care reflectă/manifestă aceste trăsături.
În corpurile de date, alte motivații există pentru răspunsuri prolixe, cum ar fi incentivul SEO de a produce conținut text mai lung, de exemplu în posturile de rețete, în care lungimea devine (adesea în mod eronat) asociată cu autoritatea.
Ce nu poate fi exclus în total este faptul că platformele bazate pe API, stimulate să îi îndemne pe utilizatori să treacă la un nivel de abonament mai mare și mai scump, fie încurajează, fie nu supraveghează verbositatea, deoarece crește utilizarea tokenului foarte ieftin, fără a necesita o raționament excesiv sau apeluri RAG†.
Articolul nou se intitulează Constrângerile de concizie inversează ierarhiile de performanță în modelele de limbaj și provine de la Departamentul de Științe ale Calculatoarelor de la Institutul Politehnic din Suedia, în Chattogram, Bangladesh.
Metodă
Pentru a testa teoriile articolului, au fost evaluate 31 de modele de limbaj – prea multe pentru a fi enumerate aici în text, dar reprezentate în imaginea de mai jos:

Modelele de limbaj mare (LLM) testate în diverse părți ale încercărilor pentru noul articol.
Modelele au fost evaluate împotriva a cinci colecții de referință: GSM8K, pentru raționament matematic; BoolQ, pentru înțelegerea citirii; CommonsenseQA, pentru raționamentul comun; ARC-Easy, care acoperă întrebări științifice; și MMLU-STEM, pentru cunoștințe științifice.
Răspunsurile au fost generate folosind decodarea avidă pentru a asigura ieșiri deterministice, apoi extrase cu reguli specifice sarcinii, cu acuratețea măsurată ca fiind partea de răspunsuri corecte împotriva adevărului de bază.
Modelele au fost împărțite în funcție de mărime, cele cu parametrii de până la zece miliarde fiind tratate ca “mici”, iar cele peste șaptezeci de miliarde ca “mari”, pe baza decalajelor de performanță observate.
Scalarea inversă a fost cuantificată prin compararea performanței acestor grupuri pe fiecare problemă, marcând cazurile în care modelele mai mici au depășit modelele mai mari; dimensiunea efectului statistic a fost apoi utilizată pentru a confirma că aceste decalaje reflectă diferențe semnificative și consistente, și nu zgomot.
Excluderea recăutării
Pentru a exclude posibilitatea ca modelele să fi fost pur și simplu recăutate din datele de antrenament, au fost efectuate trei verificări separate, examinând cât de variate au fost răspunsurile; cât de mult a fluctuat lungimea lor; și cum au fost făcute erorile. Dacă modelele se bazau pe modele memorizate, răspunsurile ar fi tendința să se repete sau să urmeze șabloane fixe; în schimb, răspunsurile s-au dovedit a fi în mare parte unice între modele, cu variații notabile în lungime, de la un răspuns la altul.
Erorile au fost inspectate direct, majoritatea eșecurilor luând forma explicații lungi și incorecte, mai degrabă decât răspunsuri scurte și evazive – indicând faptul că modelele au generat un raționament real, și nu au recuperat răspunsuri stocate.
Date și teste
Testarea pentru întrebări individuale, și nu pentru scoruri generale, o parte semnificativă a sarcinilor de referință s-a dovedit a fi nefolositoare, cu 27,1% care nu au reușit să separe modelele deloc, deoarece fie toate sistemele au reușit, fie toate sistemele au eșuat, lăsând niciun semnal real despre performanța relativă:

Descompunerea la nivel de problemă pe cinci benchmark-uri a arătat că o parte semnificativă a sarcinilor nu a reușit să diferențieze modelele, în timp ce o parte mai mică, dar consistentă, a prezentat o scalare inversă, în care modelele mai mici au depășit modelele mai mari. Distribuția generală pe 1.485 de probleme indică faptul că 7,7% prezintă o scalare inversă. Sursă
Printre întrebările care au diferențiat modelele, majoritatea au funcționat așa cum se așteptau, cu sistemele mai mari performând mai bine, dar o parte mai mică a prezentat modelul opus, cu modelele mai mici ieșind învingătoare. Pe toate problemele, scalarea inversă a apărut în 7,7% din cazuri, indicând faptul că efectul nu este marginal.
Apariția scalării inverse
Pe cele cinci benchmark-uri, 115 de probleme au fost găsite în care modelele mai mici au depășit modelele mai mari, reprezentând 7,7% din toate sarcinile de 1.485, indicând faptul că scalarea inversă nu este o apariție rară sau marginală în acest context.
De fapt, efectul a apărut în fiecare set de date: cel mai puternic în BoolQ și mai slab în CommonsenseQA, ARC-Easy, GSM8K și MMLU-STEM, indicând faptul că este răspândit, dar variază în funcție de sarcină:

Scalarea inversă a apărut pe toate benchmark-urile, variind de la 3,9% în MMLU-STEM la 11,3% în BoolQ, cu 115 de probleme în total. Decalajele de performanță au favorizat modelele mai mici cu o medie de 28,4 puncte procentuale. Acuratețea a scăzut pe măsură ce mărimea modelului a crescut, cu modelele mici atingând 66,1%, comparativ cu 41,5% pentru cele mai mari.
Mărimea decalajului s-a dovedit a fi substanțială, cu modelele mai mici având o medie de 28,4 puncte procentuale înainte, și fiecare caz arătând același avantaj de direcție, indicând o scădere consistentă a performanței, și nu erori ocazionale sau ad hoc.
Același model a fost observat și în cadrul diferitelor familii de modele, incluzând Llama, Qwen, Gemma și Mistral, în care versiunile mai mari au funcționat mai prost decât cele mai mici, cu acuratețea tendință să scadă pe măsură ce mărimea modelului a crescut pe aceste probleme.
Decalajul dintre modelele mici și mari a fost suficient de mare pentru a face ca întâmplarea să fie puțin probabilă să-l explice; și deoarece același model a apărut în diferite benchmark-uri, sarcini și familii de modele, scalarea inversă a apărut ca un efect consistent, și nu aleator.
Privind în cadrul fiecărei familii de modele, versiunile mai mari au funcționat în mod repetat mai prost decât cele mai mici pe aceste probleme, sugerând că scăderea poate fi legată de scară în sine, și nu de diferențe de design.
Rezultatele arată, de asemenea, că există o limită pentru fiecare sarcină, în care creșterea mărimii modelului începe să dăuneze performanței, arătând că modelele mai mari nu conduc întotdeauna la rezultate mai bune.
Examinarea gândirii excesive
După ce s-a stabilit că modelele mai mari funcționează uneori mai prost pe anumite domenii, analiza s-a îndreptat spre a înțelege de ce se întâmplă acest lucru, propunând că problema nu este lipsa de capacitate, ci prea multă explicație – adică cazurile în care răspunsurile mai lungi încep să ascundă raționamentul corect.
Pe parcursul datelor, răspunsurile mai lungi au fost legate de o acuratețe mai scăzută pe aceste probleme dificile, chiar dacă modelele mari și mici au produs aproximativ același număr de pași de raționament, sugerând că problema nu este cât de mult raționament se face, ci cum este exprimat:

Răspunsurile mai scurte au îmbunătățit performanța modelului mare și au redus decalajul cu modelele mai mici, reducând diferența de la 44,2 puncte procentuale la 14,8 (și în unele cazuri inversând-o complet), în timp ce formatele de răspuns direct au îngustat-o și mai mult. Câștigurile cele mai puternice au apărut în GSM8K și MMLU-STEM, unde ierarhiile s-au inversat în favoarea modelelor mai mari, și verificările lungimii răspunsului au confirmat că intervenția a funcționat, cu ieșirile scăzând de la aproximativ 197 de tokeni la sub 80, legând verbositatea redusă de acuratețe îmbunătățită.
Când răspunsurile au fost forțate să fie mai scurte, modelele mari s-au îmbunătățit semnificativ, reducând o decalaj semnificativ de performanță, și, în unele cazuri, aproape eliminându-l. În schimb, modelele mici au schimbat foarte puțin, indicând că verbositatea activează modelele mai mari.
Efectul s-a dovedit a varia în funcție de sarcină, cu unele benchmark-uri beneficiind puternic de răspunsuri mai scurte, și altele necesitând un anumit grad de explicație; dar în mai multe cazuri, ierarhia dintre modelele mici și mari s-a inversat complet odată ce verbositatea a fost constrânsă, arătând că modelele mai mari aveau o capacitate ascunsă care era maskată de explicații excesive.
Analiza suplimentară a arătat că modelele mari au tendința să producă ieșiri mai lungi în general, în ciuda faptului că utilizează puțin mai puțini pași de raționament explicit, indicând un stil de raționament mai difuz și mai puțin structurat.
În schimb, modelele mici au oferit răspunsuri mai scurte și mai directe, sugerând că modul în care raționamentul este exprimat, și nu cantitatea de raționament în sine, conduce la scăderea performanței.
Autorii concluzionează în general că constrângerile de concizie aduc beneficii de acuratețe, și consideră că acest lucru ar putea deveni o trăsătură fundamentală în modelele de limbaj, și nu o constrângere repetitivă, aplicată de utilizator, care nu supraviețuiește în timp; și afirmă:
‘Constrângerile de concizie ajută modelele mari dramatic, în timp ce afectează foarte puțin modelele mici.
‘Dacă verbositatea ar fi incidentală și nu cauzală, s-ar aștepta schimbări de acuratețe uniforme în ambele categorii de mărime. Răspunsul diferențiat confirmă că gândirea excesivă este un mod de eșec specific scării, și nu un efect de dificultate a sarcinii.’
Concluzie
Dincolo de versiunile open source testate de cercetători, problema verbositàții pare să apară, din punct de vedere anecdotic, cu o anumită frecvență în multe modele majore, altele decât ChatGPT, incluzând Claude, Gemini și Grok.
Indiferent dacă aceste platforme ignoră problema verbositàții deoarece aceasta crește utilizarea tokenului și încurajează cheltuieli mai mari†, nu pare rezonabil ca ele să accepte scăderea acurateței care însoțește această “îndemnare”.
Ar fi interesant de văzut dacă vreo metodă empirică ar putea determina cu certitudine de unde provine tendința de verbositate. Oricine a încercat vreodată să facă un chatbot să “vorbească” într-adevăr, și nu să ofere răspunsuri verbos, multi-pași, la utilizator, va fi realizat că modelul a fost puternic imprimat cu “ghiduri complete” și “soluții acceptate” în datele sale de antrenament.
Ar fi, de asemenea, foarte interesant de văzut dacă un model special antrenat pe conversații pas cu pas ar putea să se îndepărteze de tendința de a oferi răspunsuri concise. Cu toate acestea, pare probabil că anumite constrângeri sau filtre ar trebui aplicate asupra greutății pe care modelul o primește pentru “răspunsul final”, astfel încât să se antreneze direct și pe materialul precedent – esențial, raționamentul explicit din conversațiile bazate pe tururi.
Deoarece datele de acest tip par să fie rare, poate că singura cale de a înainta cu această abordare ar fi prin date sintetice, în care “concluziile compuse” finale sunt descompuse conversațional – ironic, în mod similar cu podcast-urile AI pe care Google NotebookLM le poate interpreta din intrări de text simplu.
* Conversia mea a citărilor inline ale autorilor în legături hipertext.
† Dar să fim onești, decalajul dintre costurile reale de furnizare a inteligenței artificiale și taxele de abonament este în prezent atât de mare, încât acest lucru ar dăuna doar reputației bazei de utilizatori, fără a rezolva economia severă subiacentă acestei faze a “conversiei” și “convergenței” inteligenței artificiale. Publicat inițial duminică, 5 aprilie 2026












