Andersons vinkel

AI-Chatmodeller kan føre til høje omkostninger gennem endeløs snak

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

Populære AI-chatmodeller hemmeligt spilder enorme mængder af betalte tokens på meningsløs snak. De berørte modeller er faktisk klar over, at de gør dette, men kan ikke stoppe sig selv.

 

Store resonansmodeller (LRM) som ChatGPT-5 og Google Gemini beregner mere for resonans – at gå gennem et problem skridt for skridt, hvilket kræver betydeligt mere beregningskraft end blot at forudsige næste ord. Den simulerede resonansproces tager længere tid og koster mere at køre; følgelig ender brugerne med at betale for den “ekstra tænketid”.

Men hvis du har brugt en state-of-the-art LLM for nylig, har du måske lagt mærke til, at din tildeling af tokens ofte bliver brugt på snak og overflødige ord, snarere end at fokusere på at løse de problemer, du stiller til modellen. Dette kan tage form af overdriven sycophanti, prolixe og/eller redundante svar – eller endda en slags ‘snak’, som om AI var fanget på fersk og forsøger at tale sig ud af en pinlig situation.

Naturligvis ville vi foretrække, at vores LLM’er indrømmer nederlag, følger eller tilbyder alternative veje, eller anmoder om klarhed. Men selv at få en AI af denne type til at indrømme, at den ikke kender svaret, er en betydelig udfordring i sig selv.

I mellemtiden kan brugere på lavere eller gratis niveauer finde, at de har brændt igennem deres tokens i en hurtig tak, uanset hvor målrettet eller økonomiske deres forespørgsler og interaktioner var, fordi AI selv elsker at tale; og i dette tilfælde er tale ikke billig.

Ord-Salat

Med hensyn til den nævnte ‘snak’, tilbyder en ny akademisk samarbejdsprojekt en begrundelse og en løsning ved at foreslå, at LLM’er med resonansmuligheder er tilbøjelige til at brænde igennem dine tokens, når de falder i en ‘ord-salat’-løkke – en tilstand af forvirring, hvor resonansprocessen bliver fanget i rekursive blindgyder – på din regning*.

Forskerne bag den nye artikel har fundet, at en betydelig del af de tokens, der behandles i en typisk LLM, består af gentagelser og overflødigheder – og at modellen selv synes at vide, at den er i vanskeligheder, selvom den ikke kan stoppe den dyre løkke.

Artiklen fastslår:

‘Vi viser, at en betydelig del af disse tokens er meningsløse gentagelser – hvad vi kalder “ord-salat” – der udtømmer dekodningsbudgettet uden at tilføje værdi. Interessant nok observerer vi, at LRM’er er selvbevidste, når de er fanget i disse løkker: de skjulte tilstande af <\n\n> tokens efter hver resonansdel indeholder mønstre, der tillader os at påvise ord-salat-adfærd på fersk via en enkelt-lag linear klassifikator.

‘Når det er opdaget, giver en simpel afkortning efterfulgt af en direkte regenereringsprompt betydelige længdesparende med minimal kvalitetstab. ‘

Løsningen, der tilbydes i den nye artikel, er en intervention, der kan afbryde den spirallende proces i en fejlbehæftet resonans LLM på fersk, uden at kræve indgriben i træningsdata eller den skade, der kan følge af finjustering. Rammen, der hedder OrdSalatChopper, er offentliggjort på GitHub.

Selvom den første artikel koncentrerer sig om DeepSeek-varianter som f.eks. indgange i Qwen- og Llama-serien, fastslår artiklen, at den uønskede adfærd sandsynligvis er anvendelig på en langt større del af lignende arkitekturer (herunder populære API-kun-tilbud som ChatGPT og Google Gemini).

Som artiklen bemærker, har tidligere tilbud som Demystifying Long Chain-of-Thought Reasoning in LLMs og Small Models Struggle to Learn from Strong Reasoners lignende mål, idet de bruger det lille antal offentligt tilgængelige Chain-of-Thought (CoT) resonansmodeller til at etablere et bredere problem i denne klasse af modeller:

[LRM’er] har tendens til at spilde en enorm mængde dekodningsbudget, blot ved at gentage sig selv ordret, med små variationer, eller ved at engagere sig i endeløs opregning af tilfælde, indtil hele budgettet er [udgift] – vi kalder denne adfærd for Ord-Salat, en term, der ofte bruges til at latterliggøre offentlige talsmænd for at give lange, indviklede og fyldige svar, der i sidste ende mangler substans eller klar mening.

‘”Original”-kolonnen i [tabellen nedenfor] viser, at når vi besvarer GPQA-Diamond, observerer vi, at 55%+ af tokens genereret af DeepSeek-R1-Distill-modellerne er markeret som “ord-salat-tokens”, hvor de ikke tilføjer værdi fra et semantisk synspunkt.’

Andelen af output-tokens, der er identificeret som semantisk redundant, når der besvares GPQA-Diamond. OrdSalatChopper reducerer denne overhæng fra over 55% til under 6% på tværs af alle testede DeepSeek-R1-Distill-modeller, fastslår forfatterne. [ Kilde ] https://arxiv.org/pdf/2511.00536

Andelen af output-tokens, der er identificeret som semantisk redundant, når der besvares GPQA-Diamond. OrdSalatChopper reducerer denne overhæng fra over 55% til under 6% på tværs af alle testede DeepSeek-R1-Distill-modeller, fastslår forfatterne. Kilde

Forfatterne bemærker, at forsøg på at forkorte resonansprocesser, mens man bevare answerkvaliteten, er blevet en stærk understrøm i forskningslitteraturen, navnlig long-to-short (L2S); og de observerer yderligere, at selvom deres projektformål er lignende til en håndfuld tidligere initiativer, er deres eget det første, der tilbyder en ad hoc-løsning, der ikke kræver indgriben i træningsprocessen, modelredigering eller andre mulige påvirkninger af LLM’ens grundlæggende arkitektur; og i den forstand mener de, at deres tilgang burde blive almindelig blandt anvendelige systemer:

[Det er vores ærlige overbevisning, at mange effektive resonansmetoder synes effektive delvist, fordi nuværende resonans-evalueringssæt har meget plads til forbedring.

‘Hvis vi udvikler mere omfattende evaluerings sæt – som vi sandsynligvis vil i fremtiden – forventer vi at se, at mange effektive resonansmetoder fejler eller opfører sig meget anderledes end deres standard-LRM-modstykke.’

Tidligere Overvejelser

For at spore tendensen hos resonans LLM’er til at gentage sig selv, delte forfatterne modellens output i blokke, hvor der var dobbelte linjeskift, og kontrollerede derefter, hvor lignende hver blok var til tidligere blokke:

Estimeret andel af resonansblokke, der er markeret som ord-salat under to dekodningstemperaturer (τ = 0,0, 0,6). Klassifikatoren markerer en blok som 'ord-salat', når den ligner en tidligere del af modellens output, hvilket antyder gentagelse snarere end fremgang. Resultaterne viser, at denne adfærd er udbredt på tværs af datasæt og modellstørrelser.

Estimeret andel af resonansblokke, der er markeret som ord-salat under to dekodningstemperaturer (τ = 0,0, 0,6). Klassifikatoren markerer en blok som ‘ord-salat’, når den ligner en tidligere del af modellens output, hvilket antyder gentagelse snarere end fremgang. Resultaterne viser, at denne adfærd er udbredt på tværs af datasæt og modellstørrelser.

Hvis en blok var for lignende, blev den markeret som ord-salat.

Forfatterne bemærker, at så snart en model kommer ind i ‘ord-salat’-tilstand, er det meget usandsynligt, at den kan undslippe uden ekstern hjælp, men forbliver i den dyre løkke, indtil brugerens dekodningsbudget er brugt op††:

‘Det er overflødigt at sige, at dette præsenterer et katastrofalt problem for brugere, da en ideelt set meget kortere tænketid nu er maksimeret med meningsløse gentagelser. Så brugeren betaler i virkeligheden den maksimale pris for et (sandsynligvis) forkert svar, samtidig med at de må udholde den længste slut-til-slut-forsinkelse.’

Andelen af ord-salat-blokker, der optræder før og efter afkortningspunktet (dvs. øjeblikket, hvor gentaget output begynder at dominere). De fleste gentagelser sker efter dette punkt, hvilket viser, at når en model kommer ind i en ord-salat-løkke, genvinder den sjældent uden indgriben.

Andelen af ord-salat-blokker, der optræder før og efter afkortningspunktet (dvs. øjeblikket, hvor gentaget output begynder at dominere). De fleste gentagelser sker efter dette punkt, hvilket viser, at når en model kommer ind i en ord-salat-løkke, genvinder den sjældent uden indgriben.

Forfatterne genspejler deres overraskelse, da de opdagede, at resonans LLM’er††† viste tegn på, at de var klar over deres ord-salat-tilstand. Men det er denne bevidsthed, og den måde, den indgår i modellens sandsynlige resonans tilstand, der tillader en system for indgriben:

‘Letvægten af denne lineære klassifikator åbner døren for på fersk opsporing, hvor vi kan gribe ind med forskellige operationer for at tackle modeller, der er fanget i ord-salat-løkker.’

Metode

For at påvise tilstedeværelsen af ord-salat under slutning, trænede forfatterne en simpel lineær klassifikator, der kører på den skjulte tilstand af hver dobbelt newline-token.

Hver blok, der opstod efter, at modellen var kommet ind i en gentagelsesløkke, blev behandlet som ord-salat, med denne afkorting (kaldet afkortningspunktet) brugt til at markere træningsdata. 1000 resonansspor blev genereret ved hjælp af S1-benchmark, og hver spor blev delt op i blokke adskilt af newline-tegn.

Konceptuel skema for OrdSalatChopper. Under generation analyseres den skjulte tilstand ved hver dobbelt newline-token for at påvise gentagne segmenter. Når to ord-salat-blokker er markeret i træk, stoppes generationen. En fast regenereringsprompt føjes derefter til, hvilket tillader modellen at fortsætte og afslutte svaret uden at overskride budgettet.

Konceptuel skema for OrdSalatChopper. Under generation analyseres den skjulte tilstand ved hver dobbelt newline-token for at påvise gentagne segmenter. Når to ‘ord-salat’-blokker er markeret i træk, stoppes generationen. En fast regenereringsprompt føjes derefter til, hvilket tillader modellen at fortsætte og afslutte svaret uden at overskride budgettet.

Hvis en blok blev fundet til at være meget lignende en tidligere, blev den markeret som ord-salat. Når den første vedvarende gentagelse blev identificeret, blev alle efterfølgende blokke også markeret som ord-salat for at reflektere disse løkkers vedvaren.

Klassifikatoren blev implementeret som et enkelt fuldt forbundet lag og trænet på de skjulte tilstande af de efterfølgende tokens fra den sidste transformatorblok. En separat klassifikator blev trænet for hver model, ved hjælp af disse data, og ingen finjustering blev udført under evaluering.

Data og Tests

Træning og slutning brugte fire NVIDIA A100 (80G VRAM) GPU’er, under Adam-optimeringsalgoritmen, med en læringsrate på 1×10-2, i 50 epoch.

Evalueringssættene var ‘Grade School Math’ 8000, også kendt som GSM8K; MATH-500; GPQA-DIAMOND; og AIME25 (2025).

Modellerne, der blev testet, var DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; og DeepSeek-R1-Distill-Llama-8B, alle under MIT-licens.

Målene, der blev brugt, var nøjagtighed og AUROC.

Nøjagtighed og AUROC for ord-salat-klassifikatoren på Qwen-7B på tværs af fire benchmarks og to dekodningstemperaturer. Høje score viser, at begyndelsen af gentagelse kan pålides været påviselig fra den skjulte tilstand af den efterfølgende newline-token.

Nøjagtighed og AUROC for ord-salat-klassifikatoren på Qwen-7B på tværs af fire benchmarks og to dekodningstemperaturer. Høje score viser, at begyndelsen af gentagelse kan pålides været påviselig fra den skjulte tilstand af den efterfølgende newline-token.

Af de resultater, der vises her, kommenterer forfatterne:

‘[Resultattabellen ovenfor] viser, at den lineære klassifikator er ekstremt nøjagtig i påvisning af ord-salat-blokker; dog [resultattabellen nedenfor] demonstrerer, at regenereringsprompten hjælper med at genskabe opgave-nøjagtigheden, der gik tabt fra brutalt afkortning.’

Nøjagtighed af Qwen-7B på hver benchmark ved τ = 0,6, sammenligning af præstation før ord-salat (Original), efter afkortning (Afkortet) og efter regenerering (Regenereret). Gevinsterne fra regenerering er beskedne, men konsekvente, og genskaber præstationen før løkken i de fleste tilfælde.

Nøjagtighed af Qwen-7B på hver benchmark ved τ = 0,6, sammenligning af præstation før ord-salat (Original), efter afkortning (Afkortet) og efter regenerering (Regenereret). Gevinsterne fra regenerering er beskedne, men konsekvente, og genskaber præstationen før løkken i de fleste tilfælde.

I resultattabellen nedenfor kan vi se, at WordSaladChopper forbedrede eller bevarede nøjagtighed, samtidig med at den skarpt reducerede længden af modellens output, med op til 57%:

Når WordSaladChopper bruges ved græsk dekodning (τ = 0), reducerer den længden af modellens output, undertiden med mere end halvdelen, samtidig med at den fastholder nøjagtigheden eller forbedrer den lidt, en præstation, der forbliver konsekvent på tværs af forskellige modeller og opgaver (AIME25 er udeladt på grund af forudsigeligt ustabile resultater under denne indstilling).

Når WordSaladChopper bruges ved græsk dekodning (τ = 0), reducerer den længden af modellens output, undertiden med mere end halvdelen, samtidig med at den fastholder nøjagtigheden eller forbedrer den lidt, en præstation, der forbliver konsekvent på tværs af forskellige modeller og opgaver (AIME25 er udeladt på grund af forudsigeligt ustabile resultater under denne indstilling).

De største gevinster opstod i længere svar, især på GPQA-Diamond, hvor næsten halvdelen af teksten blev fjernet uden at skade præstationen. Nedenfor kan vi se lignende resultater, når tilfældighed blev tilføjet under generation:

Ved højere temperatur (τ = 0,6) fortsætter WordSaladChopper med at forkorte output med 10-30 procent, samtidig med at nøjagtigheden forbliver stabil eller lidt forbedret på tværs af alle modeller og benchmarks (AIME25-resultaterne er gennemsnitlige for at reducere varians).

Ved højere temperatur (τ = 0,6) fortsætter WordSaladChopper med at forkorte output med 10-30 procent, samtidig med at nøjagtigheden forbliver stabil eller lidt forbedret på tværs af alle modeller og benchmarks (AIME25-resultaterne er gennemsnitlige for at reducere varians).

Her forblev nøjagtigheden stabil, og kortere output blev opnået. På tværs af brættet fortsatte systemet med at fungere, selv når modellens svar blev mere gentagne; og forfatterne bemærker, at da klassifikatoren kun kontrollerer ét token per sætning, kører den ekstremt hurtigt, selv når den bruges under live-generation.

Artiklen bemærker, at yderligere strategier i fremtidig forskning langs disse linjer kunne have gavn af at give modellen en lille regenereringsbudget efter interventionen; kontinuerlig anvendelse af et WordSaladChopper-lignende system over regenereringer; og påtvængning af en ‘slut-på-tænke’-token på modellen for at kræve dens bedste nuværende svar.

Til sidst kommenterer forskerne på kvaliteten af den nuværende tilstand af kunst i evaluering af resonansmodeller, med en kritisk tone:

[Det er vores ærlige overbevisning, at mange effektive resonansmetoder synes effektive delvist, fordi nuværende resonans-evalueringssæt har meget plads til forbedring.

‘Hvis vi udvikler mere omfattende evaluerings sæt – som vi sandsynligvis vil i fremtiden – forventer vi at se, at mange effektive resonansmetoder fejler eller opfører sig meget anderledes end deres standard-LRM-modstykke.’

Konklusion

På den skala, der er nået af førende systemer som ChatGPT, kan selv små ændringer i brugerressourcer have betydelige infrastruktur-, logistik- og omkostningsimplikationer. Dette gør effektivitet til en fælles prioritet for både udbydere og den bredere forskningskommmunitet.

Hvis den nye og letvægtssystem, der er foreslået i artiklen, blev implementeret (som skal være tilpasset til hver ny modelarkitektur), kunne den forhindre det meningsløse forbrug af tokens – hvilket kan give kunden indtryk af, at udbyderen ‘bløder’ deres tildeling i en ødsel eller bedragerisk måde. I virkeligheden ville udbyderen have gavn af at levere nyttig snarere end redundant output, der koster det samme i beregningsmæssig henseende som en ord-salat.

 

* Selvom vi ikke vil udvide på dette her, omfatter dette også lokalt vært modeller, der kan være både erhvervsmæssige og hobbyistiske, og hvor el- og produktivitets-tabene fra ord-salat kan være en faktor værd at bemærke.

Som sædvanligt er alle fremhævelser forfatternes, og ikke mine. Hvor anvendeligt har deres inline-citationer været konverteret til hyperlinks af mig.

†† Her må vi anerkende, at rammer og API’er kan tildele ‘under-budget’ til forespørgsler, sådan at en forespørgsel ikke nødvendigvis kan brænde igennem en dags tilladelse af tokens – men dette er ikke almindelig praksis, eller almindeligt diskuteret blandt API-kun-udbydere.

††† Jeg er generelt ikke parat til at antage forfatternes brug af ‘LRM’er’, da dette ikke er en mainstream-forkortelse i øjeblikket, så jeg vil bruge anden terminologi i denne artikel, efter behov.

Først publiceret torsdag, 6. november 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai