Unghiul lui Anderson
Modelele de chat AI pot genera costuri prin discuČii interminabile

Modelele populare de chat AI risipesc cantitÄČi uriaČe de tokenuri plÄtite pe verbiage inutilÄ. Modelele afectate Čtiu cÄ fac acest lucru, dar nu se pot opri singure.
Â
Modelele de raČionament de mare anvergurÄ (LRM) cum ar fi ChatGPT-5 Či Google Gemini taxeazÄ mai mult pentru raČionament â parcurgerea unui problemÄ pas cu pas, ceea ce necesitÄ mult mai multÄ putere de calcul decÃĒt simpla predicČie a urmÄtorului cuvÃĒnt. Procesul de raČionament simulat dureazÄ mai mult Či costÄ mai mult pentru a fi executat; ÃŪn consecinČÄ, utilizatorii ajung sÄ plÄteascÄ pentru aceastÄ âperioadÄ de gÃĒndire suplimentarÄâ.
Cu toate acestea, dacÄ aČi utilizat recent un model LLM de ultimÄ generaČie, aČi putea fi observat cÄ alocarea dvs. de tokenuri este adesea cheltuitÄ pe verbiage Či resturi, mai degrabÄ decÃĒt pe rezolvarea problemelor pe care le puneČi modelului. Acest lucru poate lua forma excesului de sycophancy, rÄspunsuri prolixe Či/sau redundante â sau chiar o formÄ de âdiscuČie interminabilÄâ, ca Či cum AI-ul a fost prins pe loc Či ÃŪncearcÄ sÄ scape dintr-o situaČie jenatÄ.
Natural, am dori ca LLM-urile noastre sÄ recunoascÄ ÃŪnfrÃĒngerea, sÄ urmeze sau sÄ ofere alternative, sau sÄ solicite clarificÄri. Dar chiar Či obČinerea unui rÄspuns de la un AI de acest fel este o provocare considerabilÄ ÃŪn sine.
Ãntre timp, utilizatorii de pe niveluri inferioare sau gratuite pot gÄsi cÄ au ars tokenurile la un ritm rapid, indiferent cÃĒt de Čintite sau economice au fost ÃŪntrebÄrile Či interacČiunile lor, pentru cÄ AI-ul ÃŪnsuČi ÃŪi place sÄ vorbeascÄ; Či, ÃŪn acest caz, vorbirea nu este ieftinÄ.
SalatÄ de cuvinte
Ãn legÄturÄ cu âdiscuČia interminabilÄâ menČionatÄ anterior, o nouÄ colaborare academicÄ oferÄ o raČiune Či o soluČie, propunÃĒnd cÄ LLM-urile cu capacitÄČi de raČionament sunt predispuse sÄ ardÄ tokenurile atunci cÃĒnd se blocheazÄ ÃŪntr-un âcircuit de salatÄ de cuvinteâ â o stare de zÄpÄcealÄ ÃŪn care procesul de raČionament se pierde ÃŪn alei oarbe recursive â pe banii dvs.*
CercetÄtorii din spatele noului articol au descoperit cÄ o parte semnificativÄ a tokenurilor procesate ÃŪntr-un LLM tipic constÄ ÃŪn repetiČii Či redundanČe â Či cÄ modelul ÃŪnsuČi pare sÄ ÃŪnČeleagÄ cÄ se aflÄ ÃŪn dificultate, chiar dacÄ nu poate opri bucla costisitoare.
Articolul afirmÄ:
âDemonstrÄm cÄ o parte semnificativÄ a acestor tokenuri constÄ ÃŪn repetiČii inutile â ceea ce numim âsalatÄ de cuvinteâ â care epuizeazÄ bugetul de decodare fÄrÄ a adÄuga valoare. Ãn mod interesant, observÄm cÄ LRM-urile sunt conČtiente atunci cÃĒnd sunt blocate ÃŪn aceste bucle: stÄrile ascunse ale tokenurilor care urmeazÄ fiecÄrui segment de raČionament prezintÄ modele care ne permit sÄ detectÄm comportamentul de âsalatÄ de cuvinteâ ÃŪn timp real, prin intermediul unui clasificator liniar cu o singurÄ strat.
âOdatÄ detectat, o simplÄ tÄiere urmatÄ de o regenerare promptÄ Či directÄ conduce la economii substanČiale de lungime, cu o pierdere minimÄ de calitate.â
SoluČia oferitÄ de noul articol este o intervenČie care poate ÃŪntrerupe procesul de raČionament defectuos al unui LLM ÃŪntr-un mod âla cerereâ, fÄrÄ a necesita intervenČii ÃŪn procesul de antrenament, modificÄri ale modelului sau alte impuneri asupra arhitecturii de bazÄ a unui LLM. Cadru, intitulat WordSaladChopper, a fost publicat public pe GitHub.
DeČi munca iniČialÄ se concentreazÄ pe variante DeepSeek, cum ar fi intrÄrile din seria Qwen Či Llama, articolul afirmÄ cÄ comportamentul nedorit este probabil aplicabil unei game mult mai largi de modele de raČionament asemÄnÄtor arhitecturate (inclusiv oferte populare API-numai, cum ar fi ChatGPT Či Google Gemini).
DupÄ cum noteazÄ articolul, oferte anterioare, cum ar fi Demystifying Long Chain-of-Thought Reasoning in LLMs Či Small Models Struggle to Learn from Strong Reasoners utilizeazÄ, de asemenea, numÄrul mic de modele de raČionament CoT (Chain-of-Thought) disponibile public pentru a stabili o problemÄ mai largÄ ÃŪn aceastÄ clasÄ de modeleâ :
â[LRM-urile] au tendinČa de a irosi o cantitate uriaČÄ de buget de decodare, pur Či simplu prin repetarea lor verbatim, cu variaČii minore, sau prin implicarea ÃŪn enumerarea interminabilÄ a cazurilor pÃĒnÄ cÃĒnd ÃŪntregul buget a fost cheltuit â ne referim la un astfel de comportament ca SalatÄ de cuvinte, un termen adesea folosit pentru a ironiza vorbitorii publici care oferÄ rÄspunsuri lungi, pline de jargon, care lipsesc ÃŪn esenČÄ de substanČÄ sau de ÃŪnČeles.
âColoana âOriginalâ din [tabelul de mai jos] aratÄ cÄ, atunci cÃĒnd rÄspund la GPQA-Diamond, observÄm cÄ peste 55% din tokenurile generate de modelele DeepSeek-R1-Distill sunt marcate ca âtokenuri de salatÄ de cuvinteâ, unde nu adaugÄ valoare din punct de vedere semantic.â
![Partea de tokenuri de ieČire identificate ca redundante din punct de vedere semantic atunci cÃĒnd se rÄspunde la GPQA-Diamond. WordSaladChopper reduce aceastÄ suprasarcinÄ de la peste 55% la sub 6% ÃŪn toate modelele DeepSeek-R1-Distill testate, afirmÄ autorii. [ SursÄ ] https://arxiv.org/pdf/2511.00536](https://www.unite.ai/wp-content/uploads/2025/11/table-1.jpg)
Partea de tokenuri de ieČire identificate ca redundante din punct de vedere semantic atunci cÃĒnd se rÄspunde la GPQA-Diamond. WordSaladChopper reduce aceastÄ suprasarcinÄ de la peste 55% la sub 6% ÃŪn toate modelele DeepSeek-R1-Distill testate, afirmÄ autorii. SursÄ
Autorii noteazÄ cÄ ÃŪncercÄrile de a scurta procesele de raČionament, menČinÃĒnd ÃŪn acelaČi timp calitatea rÄspunsurilor, au devenit o sub-ramurÄ puternicÄ ÃŪn literatura de specialitate, Či anume long-to-short (L2S); Či observÄ, de asemenea, cÄ, deČi obiectivele proiectului lor sunt similare cu cele ale unor iniČiative anterioare, a lor este primul care oferÄ o soluČie ad hoc care nu necesitÄ intervenČii ÃŪn procesul de antrenament, editarea modelului sau alte impuneri asupra arhitecturii de bazÄ a unui LLM; Či, ÃŪn acest sens, cred cÄ abordarea lor ar trebui sÄ devinÄ larg rÄspÃĒnditÄ ÃŪn rÃĒndul sistemelor aplicabileâ :
âConsiderÄm cÄ nu este prea mult sÄ argumentÄm cÄ [WordSaladChopper] â sau un component similar â este o necesitate pentru toate aplicaČiile LRM cu experienČÄ utilizator ÃŪn minte â
Noul articol, intitulat WordSaladChopper: Modelele de raČionament irosesc o mulČime de buget de decodare pe repetiČii inutile, conČtiente de sine, provine de la Čase cercetÄtori de la Universitatea din Minnesota, Universitatea Rice, Institutul de Tehnologie Stevens Či Lambda, Inc.
ConsideraČii anterioare
Pentru a urmÄri tendinČa modelelor de raČionament LLM de a se repeta, autorii au ÃŪmpÄrČit ieČirile modelului ÃŪn bucÄČi ori de cÃĒte ori au existat spaČii duble, apoi au verificat cÃĒt de asemÄnÄtoare era fiecare bucatÄ cu cele anterioare:

Estimarea pÄrČii de segmente de raČionament marcate ca salatÄ de cuvinte sub douÄ temperaturi de decodare (Ï = 0,0, 0,6). Clasificatorul marcheazÄ un segment ca âsalatÄ de cuvinteâ atunci cÃĒnd seamÄnÄ mult cu o parte anterioarÄ a ieČirii modelului, sugerÃĒnd repetiČie ÃŪn loc de progres. Rezultatele aratÄ cÄ acest comportament este rÄspÃĒndit ÃŪn rÃĒndul seturilor de date Či dimensiunilor modelului.
DacÄ un segment era prea asemÄnÄtor, a fost marcat ca âsalatÄ de cuvinteâ (efectiv o repetiČie inutilÄ).
CercetÄtorii noteazÄ cÄ, odatÄ ce un model intrÄ ÃŪn modul âsalatÄ de cuvinteâ, este foarte puČin probabil sÄ iasÄ din el fÄrÄ ajutor extern, rÄmÃĒnÃĒnd ÃŪn bucla costisitoare pÃĒnÄ cÃĒnd bugetul de decodare al utilizatorului este epuizatâ â :
âÃn mod evident, aceasta prezintÄ o problemÄ catastrofalÄ pentru utilizatori, deoarece o secČiune de gÃĒndire ideal mult mai scurtÄ este acum maximizatÄ cu repetiČii inutile. AČadar, utilizatorul plÄteČte efectiv costul maxim pentru un rÄspuns probabil greČit, suportÃĒnd totodatÄ cea mai lungÄ latenČÄ de la capÄt la capÄt.â

Partea de segmente de salatÄ de cuvinte care apar ÃŪnainte Či dupÄ punctul de tÄiere (adicÄ momentul ÃŪn care ieČirea repetitivÄ ÃŪncepe sÄ domine). Cele mai multe repetiČii apar dupÄ acest punct, arÄtÃĒnd cÄ, odatÄ ce un model intrÄ ÃŪntr-un buclÄ de salatÄ de cuvinte, rareori se recupereazÄ fÄrÄ intervenČie.
Autorii ÃŪČi amintesc de surpriza lor atunci cÃĒnd au descoperit cÄ modelele de raČionament LLM prezintÄ semne de conČtientizare a stÄrii de âsalatÄ de cuvinteâ. Cu toate acestea, este aceastÄ conČtientizare, Či modul ÃŪn care intrÄ ÃŪn starea probabilÄ de raČionament a modelului, care permite o intervenČie:
âUČurinČa acestui clasificator liniar deschide calea pentru detectarea ÃŪn timp real, unde putem interveni efectiv cu diverse operaČiuni pentru a aborda modelele blocate ÃŪn bucle de salatÄ de cuvinte.â
MetodÄ
Pentru a detecta prezenČa âsalatei de cuvinteâ ÃŪn timpul inferenČei, autorii au antrenat un clasificator liniar simplu care ruleazÄ pe starea ascunsÄ a fiecÄrui token de newline dublu.
Orice segment care a apÄrut dupÄ ce modelul a intrat ÃŪntr-o buclÄ de repetiČie a fost tratat ca âsalatÄ de cuvinteâ, cu aceastÄ limitÄ (numitÄ punct de tÄiere) utilizatÄ pentru a eticheta datele de antrenament. Au fost generate o mie de urme de raČionament utilizÃĒnd benchmark-ul S1, iar fiecare urmÄ a fost ÃŪmpÄrČitÄ ÃŪn bucÄČi separate prin newline.

Schema conceptualÄ pentru WordSaladChopper. Ãn timpul generÄrii, starea ascunsÄ la fiecare token de newline dublu este analizatÄ pentru a detecta segmentele repetitive. OdatÄ ce douÄ segmente de âsalatÄ de cuvinteâ sunt marcate ÃŪntr-un rÃĒnd, generarea este opritÄ. Un prompt de regenerare fix este apoi anexat, permiČÃĒnd modelului sÄ continue Či sÄ termine rÄspunsul fÄrÄ a depÄČi bugetul.
DacÄ un segment a fost gÄsit a fi foarte asemÄnÄtor cu unul anterior, a fost etichetat ca âsalatÄ de cuvinteâ. OdatÄ ce a fost identificatÄ repetiČia iniČialÄ susČinutÄ, toate segmentele ulterioare au fost etichetate, de asemenea, ca âsalatÄ de cuvinteâ pentru a reflecta persistenČa acestor bucle.
Clasificatorul a fost implementat ca o singurÄ strat de conectare completÄ Či a fost antrenat pe stÄrile ascunse ale tokenurilor care urmeazÄ din blocul de transformator final. Un clasificator separat a fost antrenat pentru fiecare model, utilizÃĒnd aceste date, Či nu s-a efectuat nici o ajustare finÄ ÃŪn timpul evaluÄrii.
Date Či teste
Antrenamentul Či inferenČa au utilizat patru GPU-uri NVIDIA A100 (80G VRAM), sub optimizerul Adam, cu o ratÄ de ÃŪnvÄČare de 1Ã10-2, timp de 50 de epoci.
Seturile de date de evaluare au fost âMatematicÄ pentru Čcoala primarÄâ 8000, cunoscut Či sub numele de GSM8K; MATH-500; GPQA-DIAMOND; Či AIME25 (2025).
Modelele testate au fost DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; Či DeepSeek-R1-Distill-Llama-8B, toate sub licenČÄ MIT.
Metricile utilizate au fost acurateČea Či AUROC.

AcurateČea Či AUROC a clasificatorului de salatÄ de cuvinte pe Qwen-7B pe patru seturi de date Či douÄ temperaturi de decodare. Scorurile ridicate confirmÄ cÄ debutul repetiČiei poate fi detectat ÃŪn mod fiabil din starea ascunsÄ a tokenului de newline care urmeazÄ.
Dintre rezultatele prezentate aici, autorii comenteazÄ:
â[Tabelul de rezultate de mai sus] aratÄ cÄ clasificatorul liniar este extrem de precis ÃŪn detectarea segmentelor de salatÄ de cuvinte; [tabelul de rezultate de mai jos] demonstreazÄ cÄ promptul de regenerare ajutÄ la recuperarea acurateČei task-ului pierdutÄ din cauza tÄierii brute.â

AcurateČea Qwen-7B pe fiecare set de date la Ï = 0,6, comparÃĒnd performanČa ÃŪnainte de salatÄ de cuvinte (Original), dupÄ tÄiere (TÄiat) Či dupÄ aplicarea regenerÄrii (Regenerat). CÃĒČtigurile din regenerare sunt modeste, dar constante, recuperÃĒnd performanČa pre-buclÄ ÃŪn majoritatea cazurilor.
Ãn tabelul de rezultate de mai jos putem vedea cÄ WordSaladChopper a ÃŪmbunÄtÄČit sau a pÄstrat acurateČea, reducÃĒnd ÃŪn acelaČi timp lungimea ieČirilor modelului, uneori cu pÃĒnÄ la 57%:

CÃĒnd WordSaladChopper este utilizat la decodarea avidÄ (Ï = 0), reduce lungimea ieČirilor modelului, uneori cu peste jumÄtate, menČinÃĒnd acurateČea aceeaČi sau uČor ÃŪmbunÄtÄČitÄ, o performanČÄ care rÄmÃĒne constantÄ printre diferite modele Či sarcini (AIME25 este omisÄ din cauza rezultatelor instabile previzibile ÃŪn acest cadru).
Cele mai mari cÃĒČtiguri au apÄrut ÃŪn rÄspunsuri mai lungi, ÃŪn special pe GPQA-Diamond, unde aproape jumÄtate din text a fost eliminat fÄrÄ a afecta performanČa. Mai jos putem vedea rezultate similare atunci cÃĒnd s-a adÄugat aleatoriu ÃŪn timpul generÄrii:

La o temperaturÄ mai ridicatÄ (Ï = 0,6), WordSaladChopper continuÄ sÄ scurteze ieČirile cu 10-30%, menČinÃĒnd acurateČea stabilÄ sau uČor ÃŪmbunÄtÄČitÄ ÃŪn toate modelele Či seturile de date (rezultatele AIME25 sunt mediate pentru a reduce varianČa).
Aici, acurateČea a rÄmas stabilÄ, iar ieČirile mai scurte au fost atinse. Pe tot parcursul, sistemul a continuat sÄ funcČioneze chiar Či atunci cÃĒnd rÄspunsurile modelului au devenit mai repetitive; Či autorii noteazÄ cÄ, deoarece clasificatorul verificÄ doar un token pe propoziČie, ruleazÄ extrem de rapid, chiar Či atunci cÃĒnd este utilizat ÃŪn timpul generÄrii live.
Articolul observÄ cÄ strategii suplimentare ÃŪn cercetÄrile viitoare de-a lungul acestor linii ar putea beneficia de acordarea unui buget de regenerare mic modelului dupÄ intervenČie; aplicarea continuÄ a unui sistem de tip WordSaladChopper pe regenerÄri; Či forČarea unui token âsfÃĒrČit de gÃĒndireâ asupra modelului, pentru a cere cel mai bun rÄspuns curent.
Ãn final, cercetÄtorii comenteazÄ calitatea stÄrii actuale a evaluÄrii modelelor de raČionament, cu un ton criticâ :
âEste convingerea noastrÄ sincerÄ cÄ multe metode de raČionament eficiente par eficiente ÃŪn parte pentru cÄ evaluÄrile actuale de raČionament au mult spaČiu pentru ÃŪmbunÄtÄČire.
âDacÄ vom dezvolta seturi de evaluare mai cuprinzÄtoare de evaluare suport â ceea ce cu siguranČÄ vom face ÃŪn viitor â ne aČteptÄm sÄ vedem multe metode de raČionament eficiente eČuÃĒnd, sau comportÃĒndu-se mult diferit decÃĒt omologii lor LRM standard.â
Concluzie
La scarÄ atinsÄ de sistemele de top, cum ar fi ChatGPT, chiar Či schimbÄri mici ÃŪn consumul de resurse ale utilizatorilor pot avea implicaČii majore de infrastructurÄ, logisticÄ Či cost. Acest lucru face ca eficienČa sÄ fie o prioritate comunÄ atÃĒt pentru furnizori, cÃĒt Či pentru comunitatea de cercetare mai largÄ.
DacÄ este implementat, noul sistem uČor Či propus ÃŪn articol (care trebuie sÄ fie antrenat personalizat pentru fiecare arhitecturÄ de model nouÄ) ar putea preveni arderea inutilÄ a tokenurilor â ceea ce ar putea da utilizatorilor impresia cÄ furnizorul âscurgeâ alocarea lor ÃŪntr-un mod risipitor sau ÃŪnČelÄtor. Ãn realitate, furnizorul se descurcÄ mai bine prin furnizarea de ieČiri utile, mai degrabÄ decÃĒt redundante, care costÄ la fel, ÃŪn termeni de calcul, ca o âsalatÄ de cuvinteâ.
Â
* DeČi nu vom discuta aici, acest lucru se extinde Či la modelele gÄzduite local, care pot fi atÃĒt corporative, cÃĒt Či hobbyiste, Či unde pierderile de electricitate Či productivitate ale âsalatei de cuvinteâ pot fi un factor demn de remarcat.
â Ca de obicei, toatÄ accentuarea aparČine autorilor, Či nu mie. Ãn cazul ÃŪn care se aplicÄ, citÄrile lor inline au fost convertite ÃŪn linkuri de mine.
â â Aici trebuie sÄ recunoaČtem cÄ cadrele Či API-urile pot aloca âsub-bugetâ pentru ÃŪntrebÄri, astfel ÃŪncÃĒt o ÃŪntrebare nu este neapÄrat capabilÄ sÄ ardÄ prin alocarea zilnicÄ de tokenuri â dar acesta nu este un obicei comun, nici nu este discutat ÃŪn mod obiČnuit printre furnizorii numai API.
â â â Sunt ÃŪn general reticent sÄ adopt utilizarea autorilor a âLRMâ, deoarece aceastÄ abreviere nu este ÃŪn prezent o abreviere mainstream, aČa cÄ voi folosi o altÄ terminologie ÃŪn acest articol, dupÄ cum este necesar.
Publicat pentru prima datÄ joi, 6 noiembrie 2025












