Unghiul lui Anderson

Modelele de chat AI pot genera costuri prin discuții interminabile

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

Modelele populare de chat AI risipesc cantități uriașe de tokenuri plătite pe verbiage inutilă. Modelele afectate știu că fac acest lucru, dar nu se pot opri singure.

 

Modelele de raționament de mare anvergură (LRM) cum ar fi ChatGPT-5 și Google Gemini taxează mai mult pentru raționament – parcurgerea unui problemă pas cu pas, ceea ce necesită mult mai multă putere de calcul decÃĒt simpla predicție a următorului cuvÃĒnt. Procesul de raționament simulat durează mai mult și costă mai mult pentru a fi executat; ÃŪn consecință, utilizatorii ajung să plătească pentru această “perioadă de gÃĒndire suplimentară”.

Cu toate acestea, dacă ați utilizat recent un model LLM de ultimă generație, ați putea fi observat că alocarea dvs. de tokenuri este adesea cheltuită pe verbiage și resturi, mai degrabă decÃĒt pe rezolvarea problemelor pe care le puneți modelului. Acest lucru poate lua forma excesului de sycophancy, răspunsuri prolixe și/sau redundante – sau chiar o formă de “discuție interminabilă”, ca și cum AI-ul a fost prins pe loc și ÃŪncearcă să scape dintr-o situație jenată.

Natural, am dori ca LLM-urile noastre să recunoască ÃŪnfrÃĒngerea, să urmeze sau să ofere alternative, sau să solicite clarificări. Dar chiar și obținerea unui răspuns de la un AI de acest fel este o provocare considerabilă ÃŪn sine.

Între timp, utilizatorii de pe niveluri inferioare sau gratuite pot găsi că au ars tokenurile la un ritm rapid, indiferent cÃĒt de țintite sau economice au fost ÃŪntrebările și interacțiunile lor, pentru că AI-ul ÃŪnsuși ÃŪi place să vorbească; și, ÃŪn acest caz, vorbirea nu este ieftină.

Salată de cuvinte

În legătură cu “discuția interminabilă” menționată anterior, o nouă colaborare academică oferă o rațiune și o soluție, propunÃĒnd că LLM-urile cu capacități de raționament sunt predispuse să ardă tokenurile atunci cÃĒnd se blochează ÃŪntr-un “circuit de salată de cuvinte” – o stare de zăpăceală ÃŪn care procesul de raționament se pierde ÃŪn alei oarbe recursive – pe banii dvs.*

Cercetătorii din spatele noului articol au descoperit că o parte semnificativă a tokenurilor procesate ÃŪntr-un LLM tipic constă ÃŪn repetiții și redundanțe – și că modelul ÃŪnsuși pare să ÃŪnțeleagă că se află ÃŪn dificultate, chiar dacă nu poate opri bucla costisitoare.

Articolul afirmă:

‘Demonstrăm că o parte semnificativă a acestor tokenuri constă ÃŪn repetiții inutile – ceea ce numim “salată de cuvinte” – care epuizează bugetul de decodare fără a adăuga valoare. În mod interesant, observăm că LRM-urile sunt conștiente atunci cÃĒnd sunt blocate ÃŪn aceste bucle: stările ascunse ale tokenurilor care urmează fiecărui segment de raționament prezintă modele care ne permit să detectăm comportamentul de “salată de cuvinte” ÃŪn timp real, prin intermediul unui clasificator liniar cu o singură strat.

‘Odată detectat, o simplă tăiere urmată de o regenerare promptă și directă conduce la economii substanțiale de lungime, cu o pierdere minimă de calitate.’

Soluția oferită de noul articol este o intervenție care poate ÃŪntrerupe procesul de raționament defectuos al unui LLM ÃŪntr-un mod “la cerere”, fără a necesita intervenții ÃŪn procesul de antrenament, modificări ale modelului sau alte impuneri asupra arhitecturii de bază a unui LLM. Cadru, intitulat WordSaladChopper, a fost publicat public pe GitHub.

Deși munca inițială se concentrează pe variante DeepSeek, cum ar fi intrările din seria Qwen și Llama, articolul afirmă că comportamentul nedorit este probabil aplicabil unei game mult mai largi de modele de raționament asemănător arhitecturate (inclusiv oferte populare API-numai, cum ar fi ChatGPT și Google Gemini).

După cum notează articolul, oferte anterioare, cum ar fi Demystifying Long Chain-of-Thought Reasoning in LLMs și Small Models Struggle to Learn from Strong Reasoners utilizează, de asemenea, numărul mic de modele de raționament CoT (Chain-of-Thought) disponibile public pentru a stabili o problemă mai largă ÃŪn această clasă de modele†:

‘[LRM-urile] au tendința de a irosi o cantitate uriașă de buget de decodare, pur și simplu prin repetarea lor verbatim, cu variații minore, sau prin implicarea ÃŪn enumerarea interminabilă a cazurilor pÃĒnă cÃĒnd ÃŪntregul buget a fost cheltuit – ne referim la un astfel de comportament ca Salată de cuvinte, un termen adesea folosit pentru a ironiza vorbitorii publici care oferă răspunsuri lungi, pline de jargon, care lipsesc ÃŪn esență de substanță sau de ÃŪnțeles.

‘Coloana “Original” din [tabelul de mai jos] arată că, atunci cÃĒnd răspund la GPQA-Diamond, observăm că peste 55% din tokenurile generate de modelele DeepSeek-R1-Distill sunt marcate ca “tokenuri de salată de cuvinte”, unde nu adaugă valoare din punct de vedere semantic.’

Partea de tokenuri de ieșire identificate ca redundante din punct de vedere semantic atunci cÃĒnd se răspunde la GPQA-Diamond. WordSaladChopper reduce această suprasarcină de la peste 55% la sub 6% ÃŪn toate modelele DeepSeek-R1-Distill testate, afirmă autorii. [ Sursă ] https://arxiv.org/pdf/2511.00536

Partea de tokenuri de ieșire identificate ca redundante din punct de vedere semantic atunci cÃĒnd se răspunde la GPQA-Diamond. WordSaladChopper reduce această suprasarcină de la peste 55% la sub 6% ÃŪn toate modelele DeepSeek-R1-Distill testate, afirmă autorii. Sursă

Autorii notează că ÃŪncercările de a scurta procesele de raționament, menținÃĒnd ÃŪn același timp calitatea răspunsurilor, au devenit o sub-ramură puternică ÃŪn literatura de specialitate, și anume long-to-short (L2S); și observă, de asemenea, că, deși obiectivele proiectului lor sunt similare cu cele ale unor inițiative anterioare, a lor este primul care oferă o soluție ad hoc care nu necesită intervenții ÃŪn procesul de antrenament, editarea modelului sau alte impuneri asupra arhitecturii de bază a unui LLM; și, ÃŪn acest sens, cred că abordarea lor ar trebui să devină larg răspÃĒndită ÃŪn rÃĒndul sistemelor aplicabile†:

‘Considerăm că nu este prea mult să argumentăm că [WordSaladChopper] – sau un component similar – este o necesitate pentru toate aplicațiile LRM cu experiență utilizator ÃŪn minte ‘

Noul articol, intitulat WordSaladChopper: Modelele de raționament irosesc o mulțime de buget de decodare pe repetiții inutile, conștiente de sine, provine de la șase cercetători de la Universitatea din Minnesota, Universitatea Rice, Institutul de Tehnologie Stevens și Lambda, Inc.

Considerații anterioare

Pentru a urmări tendința modelelor de raționament LLM de a se repeta, autorii au ÃŪmpărțit ieșirile modelului ÃŪn bucăți ori de cÃĒte ori au existat spații duble, apoi au verificat cÃĒt de asemănătoare era fiecare bucată cu cele anterioare:

Estimarea părții de segmente de raționament marcate ca salată de cuvinte sub două temperaturi de decodare (τ = 0,0, 0,6). Clasificatorul marchează un segment ca “salată de cuvinte” atunci cÃĒnd seamănă mult cu o parte anterioară a ieșirii modelului, sugerÃĒnd repetiție ÃŪn loc de progres. Rezultatele arată că acest comportament este răspÃĒndit ÃŪn rÃĒndul seturilor de date și dimensiunilor modelului.

Dacă un segment era prea asemănător, a fost marcat ca “salată de cuvinte” (efectiv o repetiție inutilă).

Cercetătorii notează că, odată ce un model intră ÃŪn modul “salată de cuvinte”, este foarte puțin probabil să iasă din el fără ajutor extern, rămÃĒnÃĒnd ÃŪn bucla costisitoare pÃĒnă cÃĒnd bugetul de decodare al utilizatorului este epuizat††:

‘În mod evident, aceasta prezintă o problemă catastrofală pentru utilizatori, deoarece o secțiune de gÃĒndire ideal mult mai scurtă este acum maximizată cu repetiții inutile. Așadar, utilizatorul plătește efectiv costul maxim pentru un răspuns probabil greșit, suportÃĒnd totodată cea mai lungă latență de la capăt la capăt.’

Partea de segmente de salată de cuvinte care apar ÃŪnainte și după punctul de tăiere (adică momentul ÃŪn care ieșirea repetitivă ÃŪncepe să domine). Cele mai multe repetiții apar după acest punct, arătÃĒnd că, odată ce un model intră ÃŪntr-un buclă de salată de cuvinte, rareori se recuperează fără intervenție.

Partea de segmente de salată de cuvinte care apar ÃŪnainte și după punctul de tăiere (adică momentul ÃŪn care ieșirea repetitivă ÃŪncepe să domine). Cele mai multe repetiții apar după acest punct, arătÃĒnd că, odată ce un model intră ÃŪntr-un buclă de salată de cuvinte, rareori se recuperează fără intervenție.

Autorii ÃŪși amintesc de surpriza lor atunci cÃĒnd au descoperit că modelele de raționament LLM prezintă semne de conștientizare a stării de “salată de cuvinte”. Cu toate acestea, este această conștientizare, și modul ÃŪn care intră ÃŪn starea probabilă de raționament a modelului, care permite o intervenție:

‘Ușurința acestui clasificator liniar deschide calea pentru detectarea ÃŪn timp real, unde putem interveni efectiv cu diverse operațiuni pentru a aborda modelele blocate ÃŪn bucle de salată de cuvinte.’

Metodă

Pentru a detecta prezența “salatei de cuvinte” ÃŪn timpul inferenței, autorii au antrenat un clasificator liniar simplu care rulează pe starea ascunsă a fiecărui token de newline dublu.

Orice segment care a apărut după ce modelul a intrat ÃŪntr-o buclă de repetiție a fost tratat ca “salată de cuvinte”, cu această limită (numită punct de tăiere) utilizată pentru a eticheta datele de antrenament. Au fost generate o mie de urme de raționament utilizÃĒnd benchmark-ul S1, iar fiecare urmă a fost ÃŪmpărțită ÃŪn bucăți separate prin newline.

Schema conceptuală pentru WordSaladChopper. În timpul generării, starea ascunsă la fiecare token de newline dublu este analizată pentru a detecta segmentele repetitive. Odată ce două segmente de “salată de cuvinte” sunt marcate ÃŪntr-un rÃĒnd, generarea este oprită. Un prompt de regenerare fix este apoi anexat, permițÃĒnd modelului să continue și să termine răspunsul fără a depăși bugetul.

Dacă un segment a fost găsit a fi foarte asemănător cu unul anterior, a fost etichetat ca “salată de cuvinte”. Odată ce a fost identificată repetiția inițială susținută, toate segmentele ulterioare au fost etichetate, de asemenea, ca “salată de cuvinte” pentru a reflecta persistența acestor bucle.

Clasificatorul a fost implementat ca o singură strat de conectare completă și a fost antrenat pe stările ascunse ale tokenurilor care urmează din blocul de transformator final. Un clasificator separat a fost antrenat pentru fiecare model, utilizÃĒnd aceste date, și nu s-a efectuat nici o ajustare fină ÃŪn timpul evaluării.

Date și teste

Antrenamentul și inferența au utilizat patru GPU-uri NVIDIA A100 (80G VRAM), sub optimizerul Adam, cu o rată de ÃŪnvățare de 1×10-2, timp de 50 de epoci.

Seturile de date de evaluare au fost ‘Matematică pentru școala primară’ 8000, cunoscut și sub numele de GSM8K; MATH-500; GPQA-DIAMOND; și AIME25 (2025).

Modelele testate au fost DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; și DeepSeek-R1-Distill-Llama-8B, toate sub licență MIT.

Metricile utilizate au fost acuratețea și AUROC.

Acuratețea și AUROC a clasificatorului de salată de cuvinte pe Qwen-7B pe patru seturi de date și două temperaturi de decodare. Scorurile ridicate confirmă că debutul repetiției poate fi detectat ÃŪn mod fiabil din starea ascunsă a tokenului de newline care urmează.

Acuratețea și AUROC a clasificatorului de salată de cuvinte pe Qwen-7B pe patru seturi de date și două temperaturi de decodare. Scorurile ridicate confirmă că debutul repetiției poate fi detectat ÃŪn mod fiabil din starea ascunsă a tokenului de newline care urmează.

Dintre rezultatele prezentate aici, autorii comentează:

‘[Tabelul de rezultate de mai sus] arată că clasificatorul liniar este extrem de precis ÃŪn detectarea segmentelor de salată de cuvinte; [tabelul de rezultate de mai jos] demonstrează că promptul de regenerare ajută la recuperarea acurateței task-ului pierdută din cauza tăierii brute.’

Acuratețea Qwen-7B pe fiecare set de date la τ = 0,6, comparÃĒnd performanța ÃŪnainte de salată de cuvinte (Original), după tăiere (Tăiat) și după aplicarea regenerării (Regenerat). CÃĒștigurile din regenerare sunt modeste, dar constante, recuperÃĒnd performanța pre-buclă ÃŪn majoritatea cazurilor.

Acuratețea Qwen-7B pe fiecare set de date la τ = 0,6, comparÃĒnd performanța ÃŪnainte de salată de cuvinte (Original), după tăiere (Tăiat) și după aplicarea regenerării (Regenerat). CÃĒștigurile din regenerare sunt modeste, dar constante, recuperÃĒnd performanța pre-buclă ÃŪn majoritatea cazurilor.

În tabelul de rezultate de mai jos putem vedea că WordSaladChopper a ÃŪmbunătățit sau a păstrat acuratețea, reducÃĒnd ÃŪn același timp lungimea ieșirilor modelului, uneori cu pÃĒnă la 57%:

CÃĒnd WordSaladChopper este utilizat la decodarea avidă (τ = 0), reduce lungimea ieșirilor modelului, uneori cu peste jumătate, menținÃĒnd acuratețea aceeași sau ușor ÃŪmbunătățită, o performanță care rămÃĒne constantă printre diferite modele și sarcini (AIME25 este omisă din cauza rezultatelor instabile previzibile ÃŪn acest cadru).

CÃĒnd WordSaladChopper este utilizat la decodarea avidă (τ = 0), reduce lungimea ieșirilor modelului, uneori cu peste jumătate, menținÃĒnd acuratețea aceeași sau ușor ÃŪmbunătățită, o performanță care rămÃĒne constantă printre diferite modele și sarcini (AIME25 este omisă din cauza rezultatelor instabile previzibile ÃŪn acest cadru).

Cele mai mari cÃĒștiguri au apărut ÃŪn răspunsuri mai lungi, ÃŪn special pe GPQA-Diamond, unde aproape jumătate din text a fost eliminat fără a afecta performanța. Mai jos putem vedea rezultate similare atunci cÃĒnd s-a adăugat aleatoriu ÃŪn timpul generării:

La o temperatură mai ridicată (τ = 0,6), WordSaladChopper continuă să scurteze ieșirile cu 10-30%, menținÃĒnd acuratețea stabilă sau ușor ÃŪmbunătățită ÃŪn toate modelele și seturile de date (rezultatele AIME25 sunt mediate pentru a reduce varianța).

La o temperatură mai ridicată (τ = 0,6), WordSaladChopper continuă să scurteze ieșirile cu 10-30%, menținÃĒnd acuratețea stabilă sau ușor ÃŪmbunătățită ÃŪn toate modelele și seturile de date (rezultatele AIME25 sunt mediate pentru a reduce varianța).

Aici, acuratețea a rămas stabilă, iar ieșirile mai scurte au fost atinse. Pe tot parcursul, sistemul a continuat să funcționeze chiar și atunci cÃĒnd răspunsurile modelului au devenit mai repetitive; și autorii notează că, deoarece clasificatorul verifică doar un token pe propoziție, rulează extrem de rapid, chiar și atunci cÃĒnd este utilizat ÃŪn timpul generării live.

Articolul observă că strategii suplimentare ÃŪn cercetările viitoare de-a lungul acestor linii ar putea beneficia de acordarea unui buget de regenerare mic modelului după intervenție; aplicarea continuă a unui sistem de tip WordSaladChopper pe regenerări; și forțarea unui token “sfÃĒrșit de gÃĒndire” asupra modelului, pentru a cere cel mai bun răspuns curent.

În final, cercetătorii comentează calitatea stării actuale a evaluării modelelor de raționament, cu un ton critic†:

‘Este convingerea noastră sinceră că multe metode de raționament eficiente par eficiente ÃŪn parte pentru că evaluările actuale de raționament au mult spațiu pentru ÃŪmbunătățire.

‘Dacă vom dezvolta seturi de evaluare mai cuprinzătoare de evaluare suport – ceea ce cu siguranță vom face ÃŪn viitor – ne așteptăm să vedem multe metode de raționament eficiente eșuÃĒnd, sau comportÃĒndu-se mult diferit decÃĒt omologii lor LRM standard.’

Concluzie

La scară atinsă de sistemele de top, cum ar fi ChatGPT, chiar și schimbări mici ÃŪn consumul de resurse ale utilizatorilor pot avea implicații majore de infrastructură, logistică și cost. Acest lucru face ca eficiența să fie o prioritate comună atÃĒt pentru furnizori, cÃĒt și pentru comunitatea de cercetare mai largă.

Dacă este implementat, noul sistem ușor și propus ÃŪn articol (care trebuie să fie antrenat personalizat pentru fiecare arhitectură de model nouă) ar putea preveni arderea inutilă a tokenurilor – ceea ce ar putea da utilizatorilor impresia că furnizorul “scurge” alocarea lor ÃŪntr-un mod risipitor sau ÃŪnșelător. În realitate, furnizorul se descurcă mai bine prin furnizarea de ieșiri utile, mai degrabă decÃĒt redundante, care costă la fel, ÃŪn termeni de calcul, ca o “salată de cuvinte”.

 

* Deși nu vom discuta aici, acest lucru se extinde și la modelele găzduite local, care pot fi atÃĒt corporative, cÃĒt și hobbyiste, și unde pierderile de electricitate și productivitate ale “salatei de cuvinte” pot fi un factor demn de remarcat.

† Ca de obicei, toată accentuarea aparține autorilor, și nu mie. În cazul ÃŪn care se aplică, citările lor inline au fost convertite ÃŪn linkuri de mine.

†† Aici trebuie să recunoaștem că cadrele și API-urile pot aloca “sub-buget” pentru ÃŪntrebări, astfel ÃŪncÃĒt o ÃŪntrebare nu este neapărat capabilă să ardă prin alocarea zilnică de tokenuri – dar acesta nu este un obicei comun, nici nu este discutat ÃŪn mod obișnuit printre furnizorii numai API.

††† Sunt ÃŪn general reticent să adopt utilizarea autorilor a “LRM”, deoarece această abreviere nu este ÃŪn prezent o abreviere mainstream, așa că voi folosi o altă terminologie ÃŪn acest articol, după cum este necesar.

Publicat pentru prima dată joi, 6 noiembrie 2025

Scriitor pe machine learning, specialist ÃŪn domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, pÃĒnă la dizolvarea sa ÃŪn Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]