Unghiul lui Anderson

Modelele de chat AI pot genera costuri prin discuții interminabile

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

Modelele populare de chat AI risipesc cantități uriașe de tokenuri plătite pe verbiage inutilă. Modelele afectate știu că fac acest lucru, dar nu se pot opri singure.

 

Modelele de raționament de mare anvergură (LRM) cum ar fi ChatGPT-5 și Google Gemini taxează mai mult pentru raționament – parcurgerea unui problemă pas cu pas, ceea ce necesită mult mai multă putere de calcul decât simpla predicție a următorului cuvânt. Procesul de raționament simulat durează mai mult și costă mai mult pentru a fi executat; în consecință, utilizatorii ajung să plătească pentru această “perioadă de gândire suplimentară”.

Cu toate acestea, dacă ați utilizat recent un model LLM de ultimă generație, ați putea fi observat că alocarea dvs. de tokenuri este adesea cheltuită pe verbiage și resturi, mai degrabă decât pe rezolvarea problemelor pe care le puneți modelului. Acest lucru poate lua forma excesului de sycophancy, răspunsuri prolixe și/sau redundante – sau chiar o formă de “discuție interminabilă”, ca și cum AI-ul a fost prins pe loc și încearcă să scape dintr-o situație jenată.

Natural, am dori ca LLM-urile noastre să recunoască înfrângerea, să urmeze sau să ofere alternative, sau să solicite clarificări. Dar chiar și obținerea unui răspuns de la un AI de acest fel este o provocare considerabilă în sine.

Între timp, utilizatorii de pe niveluri inferioare sau gratuite pot găsi că au ars tokenurile la un ritm rapid, indiferent cât de țintite sau economice au fost întrebările și interacțiunile lor, pentru că AI-ul însuși îi place să vorbească; și, în acest caz, vorbirea nu este ieftină.

Salată de cuvinte

În legătură cu “discuția interminabilă” menționată anterior, o nouă colaborare academică oferă o rațiune și o soluție, propunând că LLM-urile cu capacități de raționament sunt predispuse să ardă tokenurile atunci când se blochează într-un “circuit de salată de cuvinte” – o stare de zăpăceală în care procesul de raționament se pierde în alei oarbe recursive – pe banii dvs.*

Cercetătorii din spatele noului articol au descoperit că o parte semnificativă a tokenurilor procesate într-un LLM tipic constă în repetiții și redundanțe – și că modelul însuși pare să înțeleagă că se află în dificultate, chiar dacă nu poate opri bucla costisitoare.

Articolul afirmă:

‘Demonstrăm că o parte semnificativă a acestor tokenuri constă în repetiții inutile – ceea ce numim “salată de cuvinte” – care epuizează bugetul de decodare fără a adăuga valoare. În mod interesant, observăm că LRM-urile sunt conștiente atunci când sunt blocate în aceste bucle: stările ascunse ale tokenurilor care urmează fiecărui segment de raționament prezintă modele care ne permit să detectăm comportamentul de “salată de cuvinte” în timp real, prin intermediul unui clasificator liniar cu o singură strat.

‘Odată detectat, o simplă tăiere urmată de o regenerare promptă și directă conduce la economii substanțiale de lungime, cu o pierdere minimă de calitate.’

Soluția oferită de noul articol este o intervenție care poate întrerupe procesul de raționament defectuos al unui LLM într-un mod “la cerere”, fără a necesita intervenții în procesul de antrenament, modificări ale modelului sau alte impuneri asupra arhitecturii de bază a unui LLM. Cadru, intitulat WordSaladChopper, a fost publicat public pe GitHub.

Deși munca inițială se concentrează pe variante DeepSeek, cum ar fi intrările din seria Qwen și Llama, articolul afirmă că comportamentul nedorit este probabil aplicabil unei game mult mai largi de modele de raționament asemănător arhitecturate (inclusiv oferte populare API-numai, cum ar fi ChatGPT și Google Gemini).

După cum notează articolul, oferte anterioare, cum ar fi Demystifying Long Chain-of-Thought Reasoning in LLMs și Small Models Struggle to Learn from Strong Reasoners utilizează, de asemenea, numărul mic de modele de raționament CoT (Chain-of-Thought) disponibile public pentru a stabili o problemă mai largă în această clasă de modele†:

‘[LRM-urile] au tendința de a irosi o cantitate uriașă de buget de decodare, pur și simplu prin repetarea lor verbatim, cu variații minore, sau prin implicarea în enumerarea interminabilă a cazurilor până când întregul buget a fost cheltuit – ne referim la un astfel de comportament ca Salată de cuvinte, un termen adesea folosit pentru a ironiza vorbitorii publici care oferă răspunsuri lungi, pline de jargon, care lipsesc în esență de substanță sau de înțeles.

‘Coloana “Original” din [tabelul de mai jos] arată că, atunci când răspund la GPQA-Diamond, observăm că peste 55% din tokenurile generate de modelele DeepSeek-R1-Distill sunt marcate ca “tokenuri de salată de cuvinte”, unde nu adaugă valoare din punct de vedere semantic.’

Partea de tokenuri de ieșire identificate ca redundante din punct de vedere semantic atunci când se răspunde la GPQA-Diamond. WordSaladChopper reduce această suprasarcină de la peste 55% la sub 6% în toate modelele DeepSeek-R1-Distill testate, afirmă autorii. [ Sursă ] https://arxiv.org/pdf/2511.00536

Partea de tokenuri de ieșire identificate ca redundante din punct de vedere semantic atunci când se răspunde la GPQA-Diamond. WordSaladChopper reduce această suprasarcină de la peste 55% la sub 6% în toate modelele DeepSeek-R1-Distill testate, afirmă autorii. Sursă

Autorii notează că încercările de a scurta procesele de raționament, menținând în același timp calitatea răspunsurilor, au devenit o sub-ramură puternică în literatura de specialitate, și anume long-to-short (L2S); și observă, de asemenea, că, deși obiectivele proiectului lor sunt similare cu cele ale unor inițiative anterioare, a lor este primul care oferă o soluție ad hoc care nu necesită intervenții în procesul de antrenament, editarea modelului sau alte impuneri asupra arhitecturii de bază a unui LLM; și, în acest sens, cred că abordarea lor ar trebui să devină larg răspândită în rândul sistemelor aplicabile†:

‘Considerăm că nu este prea mult să argumentăm că [WordSaladChopper] – sau un component similar – este o necesitate pentru toate aplicațiile LRM cu experiență utilizator în minte ‘

Noul articol, intitulat WordSaladChopper: Modelele de raționament irosesc o mulțime de buget de decodare pe repetiții inutile, conștiente de sine, provine de la șase cercetători de la Universitatea din Minnesota, Universitatea Rice, Institutul de Tehnologie Stevens și Lambda, Inc.

Considerații anterioare

Pentru a urmări tendința modelelor de raționament LLM de a se repeta, autorii au împărțit ieșirile modelului în bucăți ori de câte ori au existat spații duble, apoi au verificat cât de asemănătoare era fiecare bucată cu cele anterioare:

Estimarea părții de segmente de raționament marcate ca salată de cuvinte sub două temperaturi de decodare (τ = 0,0, 0,6). Clasificatorul marchează un segment ca “salată de cuvinte” atunci când seamănă mult cu o parte anterioară a ieșirii modelului, sugerând repetiție în loc de progres. Rezultatele arată că acest comportament este răspândit în rândul seturilor de date și dimensiunilor modelului.

Dacă un segment era prea asemănător, a fost marcat ca “salată de cuvinte” (efectiv o repetiție inutilă).

Cercetătorii notează că, odată ce un model intră în modul “salată de cuvinte”, este foarte puțin probabil să iasă din el fără ajutor extern, rămânând în bucla costisitoare până când bugetul de decodare al utilizatorului este epuizat††:

‘În mod evident, aceasta prezintă o problemă catastrofală pentru utilizatori, deoarece o secțiune de gândire ideal mult mai scurtă este acum maximizată cu repetiții inutile. Așadar, utilizatorul plătește efectiv costul maxim pentru un răspuns probabil greșit, suportând totodată cea mai lungă latență de la capăt la capăt.’

Partea de segmente de salată de cuvinte care apar înainte și după punctul de tăiere (adică momentul în care ieșirea repetitivă începe să domine). Cele mai multe repetiții apar după acest punct, arătând că, odată ce un model intră într-un buclă de salată de cuvinte, rareori se recuperează fără intervenție.

Partea de segmente de salată de cuvinte care apar înainte și după punctul de tăiere (adică momentul în care ieșirea repetitivă începe să domine). Cele mai multe repetiții apar după acest punct, arătând că, odată ce un model intră într-un buclă de salată de cuvinte, rareori se recuperează fără intervenție.

Autorii își amintesc de surpriza lor atunci când au descoperit că modelele de raționament LLM prezintă semne de conștientizare a stării de “salată de cuvinte”. Cu toate acestea, este această conștientizare, și modul în care intră în starea probabilă de raționament a modelului, care permite o intervenție:

‘Ușurința acestui clasificator liniar deschide calea pentru detectarea în timp real, unde putem interveni efectiv cu diverse operațiuni pentru a aborda modelele blocate în bucle de salată de cuvinte.’

Metodă

Pentru a detecta prezența “salatei de cuvinte” în timpul inferenței, autorii au antrenat un clasificator liniar simplu care rulează pe starea ascunsă a fiecărui token de newline dublu.

Orice segment care a apărut după ce modelul a intrat într-o buclă de repetiție a fost tratat ca “salată de cuvinte”, cu această limită (numită punct de tăiere) utilizată pentru a eticheta datele de antrenament. Au fost generate o mie de urme de raționament utilizând benchmark-ul S1, iar fiecare urmă a fost împărțită în bucăți separate prin newline.

Schema conceptuală pentru WordSaladChopper. În timpul generării, starea ascunsă la fiecare token de newline dublu este analizată pentru a detecta segmentele repetitive. Odată ce două segmente de “salată de cuvinte” sunt marcate într-un rând, generarea este oprită. Un prompt de regenerare fix este apoi anexat, permițând modelului să continue și să termine răspunsul fără a depăși bugetul.

Dacă un segment a fost găsit a fi foarte asemănător cu unul anterior, a fost etichetat ca “salată de cuvinte”. Odată ce a fost identificată repetiția inițială susținută, toate segmentele ulterioare au fost etichetate, de asemenea, ca “salată de cuvinte” pentru a reflecta persistența acestor bucle.

Clasificatorul a fost implementat ca o singură strat de conectare completă și a fost antrenat pe stările ascunse ale tokenurilor care urmează din blocul de transformator final. Un clasificator separat a fost antrenat pentru fiecare model, utilizând aceste date, și nu s-a efectuat nici o ajustare fină în timpul evaluării.

Date și teste

Antrenamentul și inferența au utilizat patru GPU-uri NVIDIA A100 (80G VRAM), sub optimizerul Adam, cu o rată de învățare de 1×10-2, timp de 50 de epoci.

Seturile de date de evaluare au fost ‘Matematică pentru școala primară’ 8000, cunoscut și sub numele de GSM8K; MATH-500; GPQA-DIAMOND; și AIME25 (2025).

Modelele testate au fost DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; și DeepSeek-R1-Distill-Llama-8B, toate sub licență MIT.

Metricile utilizate au fost acuratețea și AUROC.

Acuratețea și AUROC a clasificatorului de salată de cuvinte pe Qwen-7B pe patru seturi de date și două temperaturi de decodare. Scorurile ridicate confirmă că debutul repetiției poate fi detectat în mod fiabil din starea ascunsă a tokenului de newline care urmează.

Acuratețea și AUROC a clasificatorului de salată de cuvinte pe Qwen-7B pe patru seturi de date și două temperaturi de decodare. Scorurile ridicate confirmă că debutul repetiției poate fi detectat în mod fiabil din starea ascunsă a tokenului de newline care urmează.

Dintre rezultatele prezentate aici, autorii comentează:

‘[Tabelul de rezultate de mai sus] arată că clasificatorul liniar este extrem de precis în detectarea segmentelor de salată de cuvinte; [tabelul de rezultate de mai jos] demonstrează că promptul de regenerare ajută la recuperarea acurateței task-ului pierdută din cauza tăierii brute.’

Acuratețea Qwen-7B pe fiecare set de date la τ = 0,6, comparând performanța înainte de salată de cuvinte (Original), după tăiere (Tăiat) și după aplicarea regenerării (Regenerat). Câștigurile din regenerare sunt modeste, dar constante, recuperând performanța pre-buclă în majoritatea cazurilor.

Acuratețea Qwen-7B pe fiecare set de date la τ = 0,6, comparând performanța înainte de salată de cuvinte (Original), după tăiere (Tăiat) și după aplicarea regenerării (Regenerat). Câștigurile din regenerare sunt modeste, dar constante, recuperând performanța pre-buclă în majoritatea cazurilor.

În tabelul de rezultate de mai jos putem vedea că WordSaladChopper a îmbunătățit sau a păstrat acuratețea, reducând în același timp lungimea ieșirilor modelului, uneori cu până la 57%:

Când WordSaladChopper este utilizat la decodarea avidă (τ = 0), reduce lungimea ieșirilor modelului, uneori cu peste jumătate, menținând acuratețea aceeași sau ușor îmbunătățită, o performanță care rămâne constantă printre diferite modele și sarcini (AIME25 este omisă din cauza rezultatelor instabile previzibile în acest cadru).

Când WordSaladChopper este utilizat la decodarea avidă (τ = 0), reduce lungimea ieșirilor modelului, uneori cu peste jumătate, menținând acuratețea aceeași sau ușor îmbunătățită, o performanță care rămâne constantă printre diferite modele și sarcini (AIME25 este omisă din cauza rezultatelor instabile previzibile în acest cadru).

Cele mai mari câștiguri au apărut în răspunsuri mai lungi, în special pe GPQA-Diamond, unde aproape jumătate din text a fost eliminat fără a afecta performanța. Mai jos putem vedea rezultate similare atunci când s-a adăugat aleatoriu în timpul generării:

La o temperatură mai ridicată (τ = 0,6), WordSaladChopper continuă să scurteze ieșirile cu 10-30%, menținând acuratețea stabilă sau ușor îmbunătățită în toate modelele și seturile de date (rezultatele AIME25 sunt mediate pentru a reduce varianța).

La o temperatură mai ridicată (τ = 0,6), WordSaladChopper continuă să scurteze ieșirile cu 10-30%, menținând acuratețea stabilă sau ușor îmbunătățită în toate modelele și seturile de date (rezultatele AIME25 sunt mediate pentru a reduce varianța).

Aici, acuratețea a rămas stabilă, iar ieșirile mai scurte au fost atinse. Pe tot parcursul, sistemul a continuat să funcționeze chiar și atunci când răspunsurile modelului au devenit mai repetitive; și autorii notează că, deoarece clasificatorul verifică doar un token pe propoziție, rulează extrem de rapid, chiar și atunci când este utilizat în timpul generării live.

Articolul observă că strategii suplimentare în cercetările viitoare de-a lungul acestor linii ar putea beneficia de acordarea unui buget de regenerare mic modelului după intervenție; aplicarea continuă a unui sistem de tip WordSaladChopper pe regenerări; și forțarea unui token “sfârșit de gândire” asupra modelului, pentru a cere cel mai bun răspuns curent.

În final, cercetătorii comentează calitatea stării actuale a evaluării modelelor de raționament, cu un ton critic†:

‘Este convingerea noastră sinceră că multe metode de raționament eficiente par eficiente în parte pentru că evaluările actuale de raționament au mult spațiu pentru îmbunătățire.

‘Dacă vom dezvolta seturi de evaluare mai cuprinzătoare de evaluare suport – ceea ce cu siguranță vom face în viitor – ne așteptăm să vedem multe metode de raționament eficiente eșuând, sau comportându-se mult diferit decât omologii lor LRM standard.’

Concluzie

La scară atinsă de sistemele de top, cum ar fi ChatGPT, chiar și schimbări mici în consumul de resurse ale utilizatorilor pot avea implicații majore de infrastructură, logistică și cost. Acest lucru face ca eficiența să fie o prioritate comună atât pentru furnizori, cât și pentru comunitatea de cercetare mai largă.

Dacă este implementat, noul sistem ușor și propus în articol (care trebuie să fie antrenat personalizat pentru fiecare arhitectură de model nouă) ar putea preveni arderea inutilă a tokenurilor – ceea ce ar putea da utilizatorilor impresia că furnizorul “scurge” alocarea lor într-un mod risipitor sau înșelător. În realitate, furnizorul se descurcă mai bine prin furnizarea de ieșiri utile, mai degrabă decât redundante, care costă la fel, în termeni de calcul, ca o “salată de cuvinte”.

 

* Deși nu vom discuta aici, acest lucru se extinde și la modelele găzduite local, care pot fi atât corporative, cât și hobbyiste, și unde pierderile de electricitate și productivitate ale “salatei de cuvinte” pot fi un factor demn de remarcat.

† Ca de obicei, toată accentuarea aparține autorilor, și nu mie. În cazul în care se aplică, citările lor inline au fost convertite în linkuri de mine.

†† Aici trebuie să recunoaștem că cadrele și API-urile pot aloca “sub-buget” pentru întrebări, astfel încât o întrebare nu este neapărat capabilă să ardă prin alocarea zilnică de tokenuri – dar acesta nu este un obicei comun, nici nu este discutat în mod obișnuit printre furnizorii numai API.

††† Sunt în general reticent să adopt utilizarea autorilor a “LRM”, deoarece această abreviere nu este în prezent o abreviere mainstream, așa că voi folosi o altă terminologie în acest articol, după cum este necesar.

Publicat pentru prima dată joi, 6 noiembrie 2025

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai