Andersons vinkel
AI-Chatmodeller Kan Føre Til Unødvendige Kostnader Gjennom Endeløs Snakking

Populære AI-chatmodeller hemmelig kaster bort store mengder betalte token på meningsløs snakking. Berørte modeller vet faktisk at de gjør dette, men kan ikke stoppe seg selv.
Store resonningsmodeller (LRM) som ChatGPT-5 og Google Gemini tar mer betalt for resonning – å gå gjennom et problem steg for steg, som bruker betydelig mer beregningskraft enn å bare raskt forutsi neste ord. Den simulerede resonningsprosessen tar lengre tid og koster mer å kjøre; derfor ender brukerne opp med å betale for denne “ekstra tenketiden”.
Men hvis du har brukt en moderne LLM nylig, kan du ha lagt merke til at din tildeling av token ofte blir brukt på snakking og unødvendig informasjon, snarere enn å fokusere på å løse problemene du stiller til modellen. Dette kan ta form av overflodig sycophancy, prolixe og/eller redundante svar – eller selv en slags ‘snakking’, som om AI-en hadde blitt tatt på fersken og prøver å snakke seg ut av en vanskelig situasjon.
Naturligvis ville vi ønske at våre LLM-er innrømmet nederlag, fulgte eller tilbød alternative løsninger, eller ba om klargjøring. Men å få en AI av denne typen til å innrømme at de ikke vet et svar er en betydelig utfordring i seg selv.
I mellomtiden kan brukere på lavere eller gratis nivåer finne seg selv med å ha brent gjennom tokenene sine i en rask takt, uansett hvor målrettede eller økonomiske deres spørsmål og interaksjoner var, fordi AI-en selv elsker å snakke; og i dette tilfelle er snakking ikke billig.
Ord-Salat
I forhold til den ovennevnte ‘snakkingen’, tilbyr en ny akademisk samarbeid en rasjonalisering og en løsning, ved å foreslå at LLM-er med resonningsmuligheter er utsatt for å brenne gjennom tokenene dine når de havner i en ‘ord-salat’-løkke – en tilstand av forvirring hvor resonningsprosessen havner i rekursive blindgater – på din bekostning*.
Forskerne bak den nye artikkelen har funnet ut at en betydelig del av tokenene som prosesseres i en typisk LLM består av gjentakelser og redundanser – og at modellen selv synes å forstå at den er i trøbbel, selv om den ikke kan stoppe den kostbare løkken.
Artikkelen sier:
‘Vi viser at en betydelig del av disse tokenene er unyttige selv-gjentakelser – det vi kaller “ord-salat” – som uttømmer dekoding-budsjettet uten å legge til verdi. Interessant nok observerer vi at LRM-er er selv-bevisste når de er fanget i disse løkkene: de skjulte tilstandene av <\n\n> tokenene som følger hver resonnings-blokk, viser mønster som tillater oss å påvise ord-salat-atferd på en enkel måte via en enkelt-lag linear klassifikator.
‘Når det er påvist, kan en enkel kutting føyet til en rettfram regenererings-prompt, noe som gir betydelige lengde-besparelser med minimal kvalitets-tap.’
Løsningen som tilbys i den nye artikkelen er en intervensjon som kan kutte av den spiralske prosessen til en feil LRM på en enkel måte, uten å inkludere trening-data, eller noen av skadene som kan følge fra fine-tuning. Rammen, kalt OrdSalatChopper, er publisert på GitHub.
Selv om den innledende artikkelen konsentrerer seg om DeepSeek-varianter som innganger i Qwen- og Llama-serien, påstår artikkelen at den uønskede atferden sannsynligvis er tilstede i en mye større del av lignende arkitektur-resonningsmodeller (inkludert populære API-baserte tilbud som ChatGPT og Google Gemini).
Som artikkelen bemerker, ligner tidligere tilbud som Demystifying Long Chain-of-Thought Reasoning in LLMs og Small Models Struggle to Learn from Strong Reasoners likewise bruker det lille antallet offentlig tilgjengelige Chain-of-Thought (CoT) resonningsmodeller for å etablere en større problemstilling blant denne klassen av modeller†:
‘[LRM-er] har en tendens til å kaste bort en enorm mengde dekoding-budsjett, bare ved å gjenta seg selv ordrett, med små variasjoner, eller å engasjere seg i endeløs oppramsing av tilfeller til all budsjett er brukt – vi kaller denne atferden for Ord-Salat, en betegnelse som ofte brukes for å latterliggjøre offentlige talsmenn for å gi lange, vage og jargong-fylte svar som til slutt mangler substans eller klart mening.
‘“Original”-kolonnen i [tabellen nedenfor] viser at når vi svarer på GPQA-Diamond, observerer vi at 55%+ av tokenene generert av DeepSeek-R1-Distill-modellene er merket som “ord-salat-token”, hvor de ikke legger til verdi fra et semantisk ståsted.’
![Andelen av utgangstoken som er identifisert som semantisk redundante når de svarer på GPQA-Diamond. OrdSalatChopper reduserer denne overhodemengden fra over 55% til under 6% over alle testede DeepSeek-R1-Distill-modeller, hevder forfatterne. [ Kilde ] https://arxiv.org/pdf/2511.00536](https://www.unite.ai/wp-content/uploads/2025/11/table-1.jpg)
Andelen av utgangstoken som er identifisert som semantisk redundante når de svarer på GPQA-Diamond. OrdSalatChopper reduserer denne overhodemengden fra over 55% til under 6% over alle testede DeepSeek-R1-Distill-modeller, hevder forfatterne. Kilde
Forfatterne bemerker at forsøk på å forkorte resonningsprosesser mens de bevare svarkvalitet har blitt en sterk undergren i forskningslitteraturen, nemlig lang-til-kort (L2S); og observerer videre at selv om deres prosjektmål er lignende til noen tidligere initiativer, er deres eget det første som tilbyr en ad hoc-løsning som ikke krever inngripen i treningsprosessen, modell-redigering eller andre mulige inngrep på LLM-ens grunnarkitektur; og i den forstand tror de at deres tilnærming burde bli utbredt blant anvendelige systemer†:
‘Vi tror det ikke er for langt gått å hevde at [OrdSalatChopper] – eller en lignende komponent – er et måtte-ha for alle LRM-applikasjoner med bruker-erfaring i mente ‘
Den nye artikkelen har tittelen OrdSalatChopper: Resonningsmodeller kaster bort en mengde dekoding-budsjett på unyttige gjentakelser, selv-bevisst, og kommer fra seks forskere på University of Minnesota, Rice University, Stevens Institute of Technology og Lambda, Inc.
Tidligere Vurderinger
For å spore tendensen til at resonnings-LRM-er gjentar seg selv, delte forfatterne modellens utgang i blokker hvor det var doble linjeskift, og sjekket hvor lik hver blokk var til tidligere blokker:

Estimert andel av resonnings-blokker merket som ord-salat under to dekoding-temperaturer (τ = 0,0, 0,6). Klassifikatoren merker en blokk som ‘ord-salat’ når den ligner en tidligere del av modellens utgang, noe som antyder gjentakelse snarere enn fremgang. Resultatene viser at denne atferden er utbredt over datasett og modell-størrelser.
Hvis en blokk var for lik, ble den merket som ‘ord-salat’ (i praksis en unyttig gjentakelse).
Forskerne bemerker at når en modell går inn i ‘ord-salat’-modus, er det svært usannsynlig at den kan komme ut av det uten ekstern hjelp, men forblir i den dyre løkken til brukerens dekoding-budsjett er brukt††:
‘Det er åpenbart at dette presenterer en katastrofal situasjon for brukerne, da en ideelt sett mye kortere tenke-seksjon nå er maksimalt utvidet med unyttige gjentakelser. Så brukeren betaler i praksis maksimalt for et (sannsynligvis) feil svar, samtidig som de må utstå den lengste sluttløsningen.’

Andelen av ord-salat-blokker som oppstår før og etter kutte-punktet (dvs. øyeblikket når gjentakende utgang begynner å dominere). De fleste gjentakelser skjer etter dette punktet, og viser at når en modell går inn i en ord-salat-løkke, gjør den sjelden noen fremgang uten inngripen.
Forfatterne gjenforteller sin overraskelse da de oppdaget at resonnings-LRM-er††† viste tegn på å være klar over sin ord-salat-tilstand. Men det er denne bevisstheten, og måten den kommer inn i modellens sannsynlige resonnings-tilstand, som tillater en intervensjons-mekanisme:
‘Lettheten av denne lineære klassifikatoren åpner døren for på-vei-dettekting, hvor vi kan gripe inn med forskjellige operasjoner for å håndtere modeller fanget i ord-salat-løkker.’
Metode
For å påvise tilstedeværelsen av ord-salat under inferens, trente forfatterne en enkel lineær klassifikator som kjører på den skjulte tilstanden av hver doblet linjeskift-token.
Hver blokk som skjedde etter at modellen gikk inn i en gjentakelses-løkke, ble behandlet som ord-salat, med denne avkuttingen (kalt kutte-punktet) brukt til å merke trenings-data. 1000 resonnings-spor ble generert ved hjelp av S1-benchmark, og hver spor ble delt inn i blokker adskilt av linjeskift.

Konseptuell skisse for OrdSalatChopper. Under generering, analyseres den skjulte tilstanden ved hver doblet linjeskift-token for å påvise gjentakende segmenter. Når to ord-salat-blokker er merket på rad, stoppes genereringen. En fast regenererings-prompt blir deretter føyet til, og tillater modellen å fortsette og fullføre svaret uten å overskride budsjettet.
Hvis en blokk ble funnet å være svært lik en tidligere, ble den merket som ord-salat. Når den tidligste vedvarende gjentakelsen ble identifisert, ble alle påfølgende blokker også merket som ord-salat for å reflektere varigheten av disse løkkene.
Klassifikatoren ble implementert som ett fullt tilkoblet lag og trent på de skjulte tilstandene av de siste transformator-blokke. En separat klassifikator ble trent for hver modell, ved hjelp av denne data, og ingen fine-tuning ble utført under evaluering.
Data og Tester
Trenings- og inferens brukte fire NVIDIA A100 (80G VRAM) GPU-er, under Adam-optimalisatoren, med en læring-rate på 1×10-2, i 50 epoker.
Evaluering-datasettene var ‘Grade School Math’ 8000, også kjent som GSM8K; MATH-500; GPQA-DIAMOND; og AIME25 (2025).
Modellene som ble testet var DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; og DeepSeek-R1-Distill-Llama-8B, alle under MIT-lisens.
Målinger som ble brukt var Nøyaktighet og AUROC.

Nøyaktighet og AUROC av ord-salat-klassifikatoren på Qwen-7B over fire benchmark og to dekoding-temperaturer. Høye poengsummer bekrefter at påstarten av gjentakelse kan pålitelig påvises fra den skjulte tilstanden av den siste linjeskift-token.
Av resultattabellene her, kommenterer forfatterne:
‘[Resultattabellen ovenfor] viser at den lineære klassifikatoren er ekstremt nøyaktig i å påvise ord-salat-blokker; [resultattabellen nedenfor] demonstrerer at regenererings-prompten hjelper med å gjenopprette oppgave-nøyaktigheten som ble tapt fra brutt-kutting.’

Nøyaktighet av Qwen-7B på hver benchmark ved τ = 0,6, sammenlignet med prestasjon før ord-salat (Original), etter kutting (Kuttet) og etter å ha brukt regenerering (Regenerert). Gevinster fra regenerering er beskjedne, men konsistente, og gjenoppretter pre-loop-prestasjon i de fleste tilfeller.
I resultattabellen nedenfor kan vi se at WordSaladChopper forbedret eller bevarte nøyaktighet samtidig som den kraftig reduserte lengden av modell-utgang, med opptil 57%:

Når WordSaladChopper brukes ved grådig dekoding (τ = 0), reduserer den lengden av modell-utgang, noen ganger med over halvparten, mens den holder nøyaktigheten lik eller litt bedre, en prestasjon som forblir konsistent blant ulike modeller og oppgaver (AIME25 er utelatt på grunn av forutsigbare ustabile resultater under denne innstillingen).
De største gevinster dukket opp i lengre svar, spesielt på GPQA-Diamond, hvor nesten halvparten av teksten ble fjernet uten å skade prestasjonen. Under kan vi se lignende resultater når tilfeldighet ble lagt til under generering:

Ved høyere temperatur (τ = 0,6) fortsetter WordSaladChopper å forkorte utgang med 10-30 prosent, mens nøyaktigheten forblir stabil eller litt forbedret over alle modeller og benchmark (AIME25-resultatene er gjennomsnittlig for å redusere variasjon).
Her forble nøyaktigheten stabil, med kortere utgang oppnådd. Over hele linjen fortsatte systemet å fungere selv når modellens svar ble mer gjentakende; og forfatterne bemerker at siden klassifikatoren bare sjekker ett token per setning, kjører den ekstremt raskt, selv når den brukes under live-generering.
Artikkelen observerer at ytterligere strategier i fremtidig forskning langs disse linjene kunne dra nytte av å gi modellen en liten regenererings-budsjett etter intervensjonen; kontinuerlig anvendelse av en WordSaladChopper-lignende system over regenereringer; og å tvinge en ‘slutt-på-tenk’-token på modellen, for å kreve dens beste nåværende svar.
Til slutt kommenterer forskerne på kvaliteten av den nåværende tilstanden av kunnskap i evaluering av resonningsmodeller, med en kritisk tone†:
‘Det er vår ærlige tro at mange effektive resonnings-metoder synes å være effektive delvis fordi nåværende resonnings-evaluering-benchmark har mye rom for forbedring.
‘Hvis vi utvikler mer omfattende evaluerings suiter – som vi sannsynligvis vil i fremtiden – forventer vi å se at mange effektive resonnings-metoder feiler, eller oppfører seg mye annerledes enn deres vanlige LRM-tilsvarende.’
Konklusjon
På skalaen nådd av ledende systemer som ChatGPT, kan selv små endringer i bruker-resurs-forbruk ha betydelige konsekvenser for infrastruktur, logistikk og kostnader. Dette gjør effektivitet til en felles prioritet for både leverandører og den bredere forsknings-samfunnet.
Hvis den nye og lette systemet som foreslås i artikkelen blir implementert (som må være tilpasset hver ny modell-arkitektur) kunne det forhindre unødvendig forbruk av token – noe som kan gi kunden inntrykk av at leverandøren “blør” ut deres tildeling på en sløs eller bedragerisk måte. I virkeligheten gjør leverandøren det bedre ved å levere nyttig snarere enn redundant utgang, som koster like mye i beregnings-termer som et ord-salat.
* Selv om vi ikke vil utdype dette her, utvides dette også til lokalt vertede modeller, som kan være både bedrifts- og hobby-basert, og hvor strøm- og produktivitets-tapet fra ord-salat kan være en verdi å merke seg.
† Som vanlig er all vektlegging forfatternes, og ikke min egen. Der hvor det er aktuelt, har deres inline-henvisninger blitt konvertert til lenker av meg.
†† Her må vi anerkjenne at rammer og API-er kan tildele ‘under-budsjett’ til spørsmål, så at ett spørsmål ikke nødvendigvis kan forbruke en dags tildeling av token – men dette er ikke vanlig praksis, eller vanlig diskutert blant API-baserte leverandører.
††† Jeg er ikke generelt villig til å adoptere forfatternes bruk av ‘LRM-er’, da dette ikke er en nåværende mainstream-forkortelse, så jeg vil bruke annen terminologi i denne artikkelen, etter behov.
Først publisert torsdag, 6. november 2025












