Andersonův úhel

Modely AI chatů mohou zvyšovat náklady nekonečným bláboláním

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

Populární modely AI chatů tajně plýtvají obrovským množstvím placených tokenů na zbytečnou verbiáž. Postižené modely si jsou vědomy toho, že tak činí, ale nemohou se sami zastavovat.

 

Velké modely rozumění (LRM) jako ChatGPT-5 a Google Gemini účtují více za rozumění – procházení problému krok za krokem, což využívá mnohem více výpočetního výkonu než jen rychlé předpovídání dalšího slova. Simulovaný proces rozumění trvá déle a stojí více na běh, v důsledku čehož uživatelé nakonec platí za tu “extra myšlení dobu”.

Jenže pokud jste nedávno používali nejmodernější LLM, možná jste si všimli, že vaše přidělení tokenů je často vynakládáno na verbiáž a odpad, spíše než na řešení problémů, které modelu předkládáte. To může mít podobu nadměrné sycophancie, prolix a/nebo redundantních odpovědí – nebo dokonce某 druh “blábolání”, jako by AI byl zachycen na místě a snaží se vymluvit ze své nepříjemné situace.

Přirozeně bychom raději, aby naše LLMs uznaly porážku, následovaly nebo nabízely alternativní cesty, nebo žádaly o objasnění. Ale dokonce dostat AI tohoto druhu, aby uznal, že nezná odpověď, je významnou výzvou sama o sobě.

Mezitím mohou uživatelé na nižších nebo bezplatných úrovních zjistit, že rychle prošly svými tokeny, bez ohledu na to, jak byly jejich dotazy a interakce cílené nebo ekonomické, protože AI sama miluje mluvit; a v tomto případě není mluvení levné.

Word Salad

V souvislosti s výše zmíněným “bláboláním” nabízí nová akademická spolupráce vysvětlení a řešení, navrhuje, že LLMs s možnostmi rozumění jsou náchylné k prošívání tokenů, když se dostanou do “word salad” smyčky – stavu zmatku, kde se proces rozumění ztratí v rekursivních slepých uličkách – na účet uživatele*.

Vědci za novou prací zjistili, že významná část tokenů zpracovaných v typickém LLM se skládá z opakování a redundancí – a že model sám seems to understand that it is in trouble, i když nemůže zastavit nákladnou smyčku.

Práce uvádí:

‘We show that a significant portion of these tokens are useless self-repetitions – what we call “word salad” – that exhaust the decoding budget without adding value. Interestingly, we observe that LRMs are self-aware when trapped in these loops: the hidden states of <\n\n> tokens trailing each reasoning chunk exhibit patterns that allow us to detect word salad behavior on-the-fly via a single-layer linear classifier.

‘Once detected, a simple chop appended by a straightforward regeneration prompt yields substantial length savings with minimal quality loss.’

Řešení nabízené novou prací je zásah, který může odstřihnout spirálový proces chybného LRM způsobem, bez nutnosti zahrnout do tréninkových dat, nebo jakéhokoli poškození , které může vzniknout z jemného ladění. Rámec, nazvaný WordSaladChopper,  byl veřejně vydán na GitHub.

Přestože počáteční práce se soustředí DeepSeek varianty, jako jsou položky v sérii Qwen a Llama, práce uvádí, že nežádoucí chování je pravděpodobně aplikovatelné na mnohem širší skupinu podobně architektonických modelů rozumění (včetně populárních nabídek pouze API, jako je ChatGPT a Google Gemini).

Jak práce uvádí, předchozí nabídky, jako Demystifying Long Chain-of-Thought Reasoning in LLMs a Small Models Struggle to Learn from Strong Reasoners rovněž používají malé množství veřejně dostupných modelů Chain-of-Thought (CoT) k zavedení širšího problému v této třídě modelů:

[LRMs] tend to waste an enormous amount of decoding budget, simply by repeating themselves verbatim, with slight variations, or engaging in endless enumeration of cases until all budget has been [expensed] – we refer to such behavior as Word Salad, a term often used to mock public spokespersons for giving long-winded, jargon-filled responses that ultimately lack substance or clear meaning.

‘The “Original” column in [the table below’] shows that when answering GPQA-Diamond, we observe 55%+ of tokens generated by DeepSeek-R1-Distill models are marked as “word salad tokens,” where they do not add value from a semantic standpoint.’

The share of output tokens identified as semantically redundant when answering GPQA-Diamond. WordSaladChopper reduces this overhead from over 55% to under 6% across all tested DeepSeek-R1-Distill models, the authors attest. [ Source ] https://arxiv.org/pdf/2511.00536

The share of output tokens identified as semantically redundant when answering GPQA-Diamond. WordSaladChopper reduces this overhead from over 55% to under 6% across all tested DeepSeek-R1-Distill models, the authors attest. Source

Autoři poznamenávají, že pokusy o zkrácení procesů rozumění při zachování kvality odpovědí se staly silnou podskupinou ve výzkumné literatuře, jmenovitě long-to-short (L2S); a dále pozorují, že zatímco jejich projektové cíle jsou podobné několika předchozím iniciativám, jejich vlastní je první, který nabízí ad hoc řešení, které nevyžaduje zásah do tréninkového procesu, editaci modelu nebo jiná možná uvalení na základní architekturu LLM; a do té míry se domnívají, že jejich přístup by se měl stát široce rozšířeným mezi aplikovatelnými systémy:

we believe it is not too far-fetched to argue that [Word Salad Chopper] – or a similar component – is a must-have for all LRM applications with user experience in mind

Nová práce je nazvána Word Salad Chopper: Reasoning Models Waste A Ton Of Decoding Budget On Useless Repetitions, Self-Knowingly, a pochází od šesti výzkumníků z University of Minnesota, Rice University, Stevens Institute of Technology a Lambda, Inc.

Prior Considerations

Pro sledování tendence LLMs k opakování se autoři rozdělili výstup modelů na části, kdykoli tam byly dvojí řádkové mezery, a poté zkontrolovali, jak podobné je každá část k předchozím:

Estimated share of reasoning chunks flagged as word salad under two decoding temperatures (τ = 0.0, 0.6). The classifier marks a chunk as 'word salad' when it closely resembles an earlier part of the model's output, suggesting repetition rather than progress. Results show that this behavior is widespread across datasets and model sizes.

Estimated share of reasoning chunks flagged as word salad under two decoding temperatures (τ = 0.0, 0.6). The classifier marks a chunk as ‘word salad’ when it closely resembles an earlier part of the model’s output, suggesting repetition rather than progress. Results show that this behavior is widespread across datasets and model sizes.

Jestliže část byla příliš podobná, byla označena jako “word salad” (efektivně zbytečné opakování).

Výzkumníci poznamenávají, že jednou model vstoupí do “word salad” režimu, je velmi nepravděpodobné, že se z něj dostane bez vnější pomoci, místo toho zůstává v nákladné smyčce, dokud nebude vyčerpán uživatelský rozpočet pro dekódován톆:

‘Needless to say, this presents a catastrophic issue to users, as an ideally much shorter thinking section is now maximized with useless repetitions. So the user is essentially paying the maximum cost for a (likely) wrong answer, while enduring the longest end-to-end latency.’

Share of word salad chunks appearing before and after the chopping point (i.e., the moment when repetitive output begins to dominate). Most repetitions occur after this point, showing that once a model enters a word salad loop, it rarely recovers without intervention.

Share of word salad chunks appearing before and after the chopping point (i.e., the moment when repetitive output begins to dominate). Most repetitions occur after this point, showing that once a model enters a word salad loop, it rarely recovers without intervention.

Autoři vzpomínají na své překvapení, když objevili, že LLMs††† vykazují známky toho, že jsou si vědomy svého “word salad” stavu. Ale právě tato vědomost a způsob, jakým vstupuje do modelova pravděpodobného stavu rozumění, umožňuje systém zásahu:

‘The lightweightness of this linear classifier opens the door for on-the-fly detection, where we can effectively intervene with different operations to address models trapped in word salad loops.’

Method

Pro detekci přítomnosti “word salad” během inferencingu autoři trénovali jednoduchý lineární klasifikátor, který běží na skrytém stavu každého double newline tokenu.

Každá část, která nastala po vstupu modelu do opakovací smyčky, byla označena jako “word salad”, s touto odřezanou částí (označovanou jako chopping point) použitou k označení tréninkových dat. Bylo vygenerováno 1000 stop pro rozumění pomocí S1 benchmarku, a každá stopa byla rozdělena do newline-separovaných částí.

Conceptual schema for WordSaladChopper. During generation, the hidden state at each double newline token is analyzed to detect repetitive segments. Once two word salad chunks are flagged in a row, generation is halted. A fixed regeneration prompt is then appended, allowing the model to continue and finish its answer without exceeding the budget.

Conceptual schema for WordSaladChopper. During generation, the hidden state at each double newline token is analyzed to detect repetitive segments. Once two ‘word salad’ chunks are flagged in a row, generation is halted. A fixed regeneration prompt is then appended, allowing the model to continue and finish its answer without exceeding the budget.

Jestliže část byla příliš podobná předchozí, byla označena jako “word salad”. Jakmile byla identifikována nejčasnější udržitelná opakování, všechny následující části byly také označeny jako “word salad” pro zachování těchto smyček.

Klasifikátor byl implementován jako jediná plně propojená vrstva a byl trénován na skrytých stavech trailing tokenu z posledního transformer bloku. Zvláštní klasifikátor byl trénován pro každý model, pomocí tohoto dat, a během hodnocení nebylo provedeno žádné jemné ladění.

Data and Tests

Trénování a inferencing použily čtyři NVIDIA A100 (80G VRAM) GPU, pod Adam optimalizátorem, s learning rate 1×10-2, po dobu 50 epoch.

Hodnoticí datové sady byly ‘Grade School Math’ 8000, a.k.a., GSM8K; MATH-500; GPQA-DIAMOND; a AIME25 (2025).

Testované modely byly DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; a DeepSeek-R1-Distill-Llama-8B, všechny pod MIT licencí.

Metriky použité byly Precision a AUROC.

Accuracy and AUROC of the word salad classifier on Qwen‑7B across four benchmarks and two decoding temperatures. High scores confirm that the onset of repetition can be reliably detected from the hidden state of the trailing newline token.

Accuracy and AUROC of the word salad classifier on Qwen‑7B across four benchmarks and two decoding temperatures. High scores confirm that the onset of repetition can be reliably detected from the hidden state of the trailing newline token.

Z výsledků uvedených zde autoři komentují:

‘[The results table above] shows that the linear classifier is extremely accurate in detecting the word salad chunks; yet [the results table below] demonstrates that the regeneration prompt helps recover the task accuracy lost from brute-force chopping.’

Accuracy of Qwen-7B on each benchmark at τ = 0.6, comparing performance before word salad (Original), after chopping (Chopped), and after applying regeneration (Regenerated). Gains from regeneration are modest but consistent, recovering pre-loop performance in most cases.

Accuracy of Qwen-7B on each benchmark at τ = 0.6, comparing performance before word salad (Original), after chopping (Chopped), and after applying regeneration (Regenerated). Gains from regeneration are modest but consistent, recovering pre-loop performance in most cases.

V tabulce níže můžeme vidět, že WordSaladChopper zlepšil nebo zachoval přesnost, zatímco výrazně snížil délku výstupů modelu, až o 57%:

When WordSaladChopper is used at greedy decoding (τ = 0), it reduces the length of model outputs, sometimes by more than half, while keeping accuracy the same or slightly better, a performance which remains consistent among different models and tasks (AIME25 is omitted due to predictably unstable results under this setting).

When WordSaladChopper is used at greedy decoding (τ = 0), it reduces the length of model outputs, sometimes by more than half, while keeping accuracy the same or slightly better, a performance which remains consistent among different models and tasks (AIME25 is omitted due to predictably unstable results under this setting).

Největší zisky se objevily v delších odpovědích, zejména na GPQA-Diamond, kde byla téměř polovina textu odstraněna bez poškození výkonu. Níže můžeme vidět podobné výsledky, když byla přidána náhodnost během generování:

At higher temperature (τ = 0.6), WordSaladChopper continues to shorten outputs by 10-30 percent, with accuracy remaining stable or slightly improved across all models and benchmarks (AIME25 results are averaged to reduce variance).

At higher temperature (τ = 0.6), WordSaladChopper continues to shorten outputs by 10-30 percent, with accuracy remaining stable or slightly improved across all models and benchmarks (AIME25 results are averaged to reduce variance).

Zde zůstala přesnost stabilní, s kratšími výstupy, které byly dosaženy. Celkově systém pokračoval v práci, i když odpovědi modelu se staly repetitivnějšími; a autoři poznamenávají, že protože klasifikátor kontroluje pouze jeden token za větu, běží extrémně rychle, i během živé generace.

Práce poznamenává, že další strategie ve výzkumu podél těchto linií by mohly mít prospěch z přidělení malého regeneračního rozpočtu modelu po zásahu; kontinuální aplikace WordSaladChopper-stylu systému přes regenerace; a vynucení “end of think” tokenu na model, aby vyžadoval jeho nejlepší aktuální odpověď.

Nakonec výzkumníci komentují kvalitu současného stavu hodnocení modelů rozumění, s kritickým tónem:

[It] is our honest belief that many efficient reasoning methods appear effective partly because current reasoning evaluation benchmarks have much room for improvement.

‘Should we develop more comprehensive evaluation suites – which we surely will in the future – we expect to see many efficient reasoning methods fail, or behave much differently than their vanilla LRM counterparts.’

Conclusion

Na úrovni dosažené vedoucími systémy, jako je ChatGPT, mohou i malé posuny v spotřebě zdrojů uživatelů mít významné důsledky pro infrastrukturu, logistiku a náklady. To činí efektivitu sdílenou prioritou pro poskytovatele i širší výzkumnou komunitu.

Jestliže bude implementován, nový a lehký systém navržen v práci (který musí být přizpůsoben pro každou novou architekturu modelu) by mohl zabránit zbytečnému spalování tokenů – což by mohlo dát zákazníkovi dojem, že poskytovatel “vyčerpává” jeho přidělení způsobem, který je plýtváním nebo klamáním. Ve skutečnosti se poskytovatelé daří lépe, pokud poskytují užitečné než redundatní výstupy, které stojí stejně, z hlediska výpočtu, jako word salad.

 

* Although we will not elaborate on it here, this also extends to locally-hosted models, which may also be corporate as well as hobbyist, and where the electricity and productivity losses of word salad may be a factor worth noting.

As usual, all emphasis is the authors’, and not my own. Where applicable, their inline citations have been converted to hyperlinks by me.

†† Here we must acknowledge that frameworks and APIs can allocate ‘sub-budget’ to queries, so that one query is not necessarily capable of burning through a day’s allowance of tokens – but this is not common practice, nor commonly discussed among API-only providers.

††† I am not generally prepared to adopt the authors’ use of ‘LRMs’, as this is not currently a mainstream abbreviation, so I will use other terminology in this article, as necessary.

First published Thursday, 6. listopadu 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]