Andersons vinkel
Hvorfor språkmodeller blir “tapt” i samtale

En ny rapport fra Microsoft Research og Salesforce (CRM ) viser at selv de mest kapable Large Language Models (LLM) bryter sammen når instruksjoner blir gitt i stadier fremfor alle på en gang. Forfatterne fant ut at ytelsen sank med gjennomsnittlig 39 prosent over seks oppgaver når en prompt ble splittert over flere omganger:

En enkelt omgangssamtale (venstre) gir de beste resultater, men er unaturlig for sluttbrukeren. En fleromgangssamtale (høyre) viser at selv de høyest rangerte og mest performante LLM-ene mister den effektive impulsen i en samtale. Kilde: https://arxiv.org/pdf/2505.06120
Enda mer slående er det at tilfeldigheten av svarene tar en nedtur, med prestisje modeller som ChatGPT-4.1 og Gemini 2.5 Pro som svinger mellom nesten perfekte svar og manifeste feil, avhengig av hvordan den samme oppgaven blir formulert; videre kan utgangskonsistensen synke med mer enn halvparten i prosessen.
For å utforske dette beteendet, innfører rapporten en metode kalt sharding*, som splitter fullestendig angitte prompter inn i mindre fragmenter og slipper dem løs en om gangen i en samtale.
I de enkleste termer er dette ekvivalent med å gi en sammenhengende og omfattende enkelt ordre på en restaurant, og la kelneren bare bekrefte forespørselen; eller også å angripe saken samarbeidende:

To ekstreme versjoner av en restaurantssamtale (ikke fra den nye rapporten, kun for illustrasjonsformål).
For å understreke, eksemplet ovenfor plasserer kanskje kunden i et negativt lys. Men kjernen i ideen som er avbildet i den andre kolonnen er en transaksjonell utveksling som klarer et problemsett før det blir angrepet – åpenbart en rasjonell og rimelig måte å nærme seg en oppgave på.
Dette oppsettet reflekteres i den nye arbeidets drip-fed, sharded tilnærming til LLM-interaksjon. Forfatterne merker at LLM-er ofte genererer over langt svar og deretter fortsetter å stole på deres egne innsikter selv etter at disse innsiktene har vist seg å være feil eller irrelevante. Denne tendensen, kombinert med andre faktorer, kan føre til at systemet mister spor av utvekslingen helt.
I virkeligheten merker forskerne hva mange av oss har funnet anekdotisk – at den beste måten å få samtalen tilbake på sporet er å starte en ny samtale med LLM-en.
‘Hvis en samtale med en LLM ikke ledet til forventede resultater, kan starten av en ny samtale som gjentar den samme informasjonen muligens gi betydelig bedre resultater enn å fortsette en pågående samtale.
‘Dette er fordi nåværende LLM-er kan bli tapt i samtalen, og våre eksperimenter viser at å holde fast i en samtale med modellen er ineffektivt. I tillegg, siden LLM-er genererer tekst med tilfeldighet, kan en ny samtale muligens lede til forbedrede resultater.’
Forfatterne anerkjenner at agente systemer som Autogen eller LangChain potensielt kan forbedre resultater ved å fungere som tolkende lag mellom sluttbrukeren og LLM-en, kun kommuniserer med LLM-en når de har samlet inn nok ‘sharded’ svar til å koagulere til en enkelt sammenhengende forespørsel (som sluttbrukeren ikke blir eksponert for).
Men forfatterne hevder at et eget abstraksjonslag ikke burde være nødvendig, eller ellers bygges direkte inn i kilde-LLM-en:
‘Et argument kan bli fremført om at multi-omgangsevner ikke er en nødvendig funksjon i LLM-er, da det kan avlastes til agentrammeverket. Med andre ord, trenger vi nativ multi-omgangsstøtte i LLM-er når et agentrammeverk kan orkestrere interaksjoner med brukere og utnytte LLM-er bare som enkelt-omgangsoperatører?…’
Men etter å ha testet påstandet over hele deres rekke med eksempler, konkluderer de:
‘[Å stole på] et agent-lignende rammeverk for å prosessere informasjon kan være begrensende, og vi argumenterer for at LLM-er bør støtte nativ multi-omgangssamtale’
Denne interessante nye rapporten har tittelen LLM-er blir tapt i multi-omgangssamtale, og kommer fra fire forskere over MS Research og Salesforce,
Fragmenterte samtaler
Den nye metoden splitter først konvensjonelle enkelt-omgangsinstruksjoner inn i mindre shards, designet for å bli introdusert på nøkkeløyeblikk under en LLM-interaksjon, en struktur som reflekterer den utforskende, frem-og-tilbake-stilen av engasjement sett i systemer som ChatGPT eller Google Gemini.
Hver opprinnelig instruksjon er en enkelt, selvstendig prompt som leverer hele oppgaven på en gang, kombinert med en høy-nivå-spørsmål, støttende kontekst og relevante betingelser. Den sharded versjonen splitter dette inn i flere mindre deler, med hver shard som bare legger til ett stykke informasjon:

Parrede instruksjoner som viser (a) en fullstendig prompt levert i en enkelt omgang og (b) dens sharded versjon brukt til å simulere en underspesifisert, multi-omgangssamtale. Semantisk sett leverer hver versjon den samme informative lasten.
Den første shard introduserer alltid hovedmålet med oppgaven, mens resten gir klargjørende detaljer. Sammen leverer de den samme innholdet som den opprinnelige prompten, men fordelt naturlig over flere omganger i samtalen.
Hver simuleringsamtale utvikler seg mellom tre komponenter: assistenten, modellen under evaluering; brukeren, en simuleringsagent med tilgang til den fullstendige instruksjonen i sharded form; og systemet, som invigilerer og scorer utvekslingen.
Samtalen begynner med at brukeren avslører den første shard og assistenten svarer fritt. Systemet klassifiserer deretter svaret til en av flere kategorier, som en klargjøringforespørsel eller en fullt svarforsøk.
Hvis modellen gjør et svarforsøk, trekker en separat komponent ut bare den relevante spannen for evaluering, og ignorerer all omgivende tekst. På hver ny omgang avslører brukeren en ekstra shard, og utløser et nytt svar. Utvekslingen fortsetter til modellen får svaret riktig eller det ikke er noen shards igjen å avsløre:

Diagram over en sharded samtale-simulering, med den evaluerte modellen merket i rødt.
Tidlige tester viste at modeller ofte spurte om informasjon som ikke hadde blitt delt ennå, så forfatterne droppet ideen om å avsløre shards i en fast rekkefølge. I stedet ble en simulator brukt til å bestemme hvilken shard som skulle avsløres neste, basert på hvordan samtalen gikk.
Bruker-simulatorn, implementert ved hjelp av GPT-4o-mini, fikk derfor full tilgang til både den fullstendige instruksjonen og samtale-historien, og ble bedt om å bestemme, på hver omgang, hvilken shard som skulle avsløres neste, basert på hvordan utvekslingen utviklet seg.
Bruker-simulatorn omformulerte også hver shard for å opprettholde samtale-flyten, uten å endre meningen. Dette tillot simuleringen å reflektere ‘gi-og-ta’-stilen av ekte dialog, samtidig som kontrollen over oppgavestrukturen ble opprettholdt.
Før samtalen begynner, får assistenten bare den grunnleggende informasjonen som trengs for å fullføre oppgaven, som en database-skjema eller en API-referanse. Den blir ikke fortalt at instruksjonene vil bli brutt opp, og den blir ikke veiledet mot en bestemt måte å håndtere samtalen på. Dette gjøres med vilje: i virkelige anvendelser er modeller nesten aldri fortalt at en prompt vil bli ufullstendig eller oppdatert over tid, og å utelate denne konteksten hjelper simuleringen å reflektere hvordan modellen oppfører seg i en mer realistisk kontekst.
GPT-4o-mini ble også brukt til å bestemme hvordan modellens svar skulle klassifiseres, og til å trekke ut eventuelle sluttsvar fra disse svarene. Dette hjalp simuleringen å forbli fleksibel, men innførte også noen feil: men etter å ha sjekket flere hundre samtaler for hånd, fant forfatterne ut at færre enn fem prosent hadde noen problemer, og færre enn to prosent viste en endring i resultatet på grunn av dem, og de betraktet dette som en lav nok feilrate innenfor prosjektets rammer.
Simuleringsscenarier
Forfatterne brukte fem typer simulering for å teste modellens atferd under forskjellige forhold, hver en variasjon over hvordan og når deler av instruksjonen blir avslørt.
I Full-innstillingen mottar modellen hele instruksjonen i en enkelt omgang. Dette representerer den standard benchmark-formatet og tjener som ytelses-basen.
Sharded-innstillingen bryter instruksjonen opp i flere deler og leverer dem en om gangen, simulering en mer realistisk, underspesifisert samtale. Dette er hovedinnstillingen brukt til å teste hvordan modeller håndterer multi-omgangsinput.
I Concat-innstillingen syes shardene sammen igjen som en enkelt liste, og beholder deres formulering, men fjerner omgangsstrukturen. Dette hjelper med å isolere effektene av samtale-fragmentering fra omformulering eller innholdstap.
I Recap-innstillingen kjøres som Sharded, men legger til en siste omgang hvor alle tidligere shards blir gjentatt før modellen gir et sluttsvar. Dette tester om en oppsummeringsprompt kan hjelpe med å gjenopprette tapt kontekst.
Til slutt går Snowball videre, ved å gjenta alle tidligere shards på hver omgang, og holder hele instruksjonen synlig mens samtalen utvikler seg – og tilbyr en mer tilgjengelig test av multi-omgangsevne.

Simuleringstyper basert på sharded instruksjoner. En fullstendig prompt blir splittet opp i mindre deler, som kan brukes til å simulere enten enkelt-omgang (Full, Concat) eller multi-omgang (Sharded, Recap, Snowball) samtaler, avhengig av hvor raskt informasjonen blir avslørt.
Oppgaver og metrikker
Seks genereringsoppgaver ble valgt for å dekke både programmering og naturlig språk-domener: kodegenereringsprompter ble tatt fra HumanEval og LiveCodeBench; Text-to-SQL-spørsmål ble hentet fra Spider; API-kall ble konstruert ved hjelp av data fra Berkeley Function Calling Leaderboard; elementære matematikkproblemer ble levert av GSM8K; tabell-kapitlingsoppgaver var basert på ToTTo; og multi-dokument-sammendrag ble hentet fra Summary of a Haystack-dataset.
Modellens ytelse ble målt ved hjelp av tre kjerne-metrikker: gjennomsnittlig ytelse, evne, og utilbøyelighet.
Gjennomsnittlig ytelse fanget hvordan godt en modell gjorde det over flere forsøk; evne reflekterte de beste resultater en modell kunne nå, basert på dens beste utgangspunkter; og utilbøyelighet målte hvor mye disse resultater varierte, med større gap mellom beste og dårligste resultater som indikerte mindre stabil atferd.
Alle poeng ble plassert på en 0-100 skala for å sikre konsistens over oppgaver, og metrikker ble beregnet for hver instruksjon – og deretter gjennomsnittlig for å gi en helhetlig bildet av modellens ytelse.

Seks sharded oppgaver brukt i eksperimentene, som dekker både programmering og naturlig språk-generering. Hver oppgave vises med en fullstendig instruksjon og dens sharded versjon. Mellom 90 og 120 instruksjoner ble tilpasset fra etablerte benchmark-oppgaver for hver oppgave.
Konkurrenter og tester
I de initielle simuleringene (med en estimert kostnad på 5000 dollar), ble 600 instruksjoner som spente over seks oppgaver sharded og brukt til å simulere tre samtale-typer: full, concat, og sharded. For hver kombinasjon av modell, instruksjon og simuleringstype, ble ti samtaler kjørt, og produserte over 200 000 simuleringer i alt – et skjema som gjorde det mulig å fange både helhetlig ytelse og dypere mål på evne og pålitelighet.
Femten modeller ble testet, som spente over en rekke leverandører og arkitekturer: OpenAI-modellene GPT-4o (versjon 2024-11-20), GPT-4o-mini (2024-07-18), GPT-4.1 (2025-04-14), og tenkingsmodellen o3 (2025-04-16).
Anthropic-modellene var Claude 3 Haiku (2024-03-07) og Claude 3.7 Sonnet (2025-02-19), som ble aksessert via Amazon Bedrock.
Google bidro med Gemini 2.5 Flash (preview-04-17) og Gemini 2.5 Pro (preview-03-25). Meta-modellene var Llama 3.1-8B-Instruct og Llama 3.3-70B-Instruct, samt Llama 4 Scout-17B-16E, via Together AI.
De andre inngangene var OLMo 2 13B, Phi-4, og Command-A, som alle ble aksessert lokalt via Ollama eller Cohere API; og Deepseek-R1, som ble aksessert via Amazon Bedrock.
For de to ‘tenkende’ modellene (o3 og R1), ble token-grensene økt til 10 000 for å akkommodere lengre resonemangs-kjeder:

Gjennomsnittlig ytelsespoeng for hver modell over seks oppgaver: kode, database, handlinger, data-til-tekst, matematikk og sammendrag. Resultater vises for tre simuleringstyper: full, concat og sharded. Modellene er sortert etter deres gjennomsnittlige full-innstillingsscore. Skygging reflekterer graden av ytelsesnedgang fra full-innstillingen, med de to siste kolonnene som rapporterer gjennomsnittlig nedgang for concat og sharded i forhold til full.
Med hensyn til disse resultater, uttaler forfatterne†:
‘På et høyt nivå ser hver modell sin ytelse forringes på hver oppgave når FULL og SHARDED-ytelse sammenlignes, med en gjennomsnittlig forringelse på -39%. Vi kaller dette fenomenet Lost in Conversation: modeller som oppnår strålende (90%+) ytelse i laboratorie-lignende settinger med fullstendig angitte, enkelt-omgangssamtaler, strever på de samme oppgavene i en mer realistisk setting når samtalen er underspesifisert og multi-omgang.’
Concat-poeng hadde gjennomsnittlig 95 prosent av full, og indikerte at ytelsesnedgangen i den sharded-innstillingen ikke kunne forklares av informasjonstap. Mindre modeller som Llama3.1-8B-Instruct, OLMo-2-13B og Claude 3 Haiku viste mer markant forringelse under concat, og antydet at mindre modeller generelt er mindre robuste til omformulering enn større modeller.
Forfatterne observerer†:
‘Overraskende, mer performante modeller (Claude 3.7 Sonnet, Gemini 2.5, GPT-4.1) blir like mye tapt i samtalen sammenlignet med mindre modeller (Llama3.1-8B-Instruct, Phi-4), med gjennomsnittlig forringelse på 30-40%. Dette skyldes i del metrikkdefinisjoner. Siden mindre modeller oppnår lavere absolutt poeng i FULL, har de mindre rom for forringelse enn de bedre modellene.
‘Kort sagt, uansett hvor sterk en LLMs enkelt-omgangsytelse er, observerer vi store ytelsesnedganger i multi-omgangssettingen.’
Den initielle testen indikerer at noen modeller holdt seg bedre i bestemte oppgaver: Command-A på handlinger, Claude 3.7 Sonnet og GPT-4.1 på kode; og Gemini 2.5 Pro på data-til-tekst, og indikerer at multi-omgangsevne varierer med domene. Tenkingsmodeller som o3 og Deepseek-R1 gjorde det ikke bedre generelt, kanskje fordi deres lengre svar innførte flere antakelser, som tenderte til å forvirre samtalen.
Pålitelighet
Forholdet mellom evne og pålitelighet, tydelig i enkelt-omgangssimuleringer, syntes å bryte sammen under multi-omgangsforhold. Mens evnen sank bare moderat, doblet utilbøyeligheten seg i gjennomsnitt. Modeller som var stabile i full-formatprompter, som GPT-4.1 og Gemini 2.5 Pro, ble like ustabile som svakere modeller som Llama3.1-8B-Instruct eller OLMo-2-13B, så snart instruksjonen ble fragmentert.

Oversikt over evne og utilbøyelighet, vist i en boksplot (a), etterfulgt av pålitelighetsresultater fra eksperimenter med 15 modeller (b), og resultater fra den gradvise sharding-testen hvor instruksjoner ble delt inn i ett til åtte shards (c).
Modellens svar varierte ofte så mye som 50 poeng på samme oppgave, selv når ingenting nytt ble lagt til, og antydet at nedgangen i ytelse ikke skyldtes mangel på ferdighet, men at modellen ble stadig mer ustabil over omgangene.
Rapporten slår fast†:
‘[Selv om] bedre modeller tenderer til å ha en litt høyere multi-omgangsevne, tenderer alle modeller til å ha lignende nivåer av utilbøyelighet. Med andre ord, i multi-omgangs-, underspesifiserte settinger, viser alle modeller vi tester svært høy utilbøyelighet, med ytelse som forringes 50 poeng på gjennomsnitt mellom beste og dårligste simuleringskjøringer for en fast instruksjon.’
For å teste om ytelsesnedgangen var knyttet til antall omganger, kjørte forfatterne en gradvis sharding-eksperiment, og delte hver instruksjon inn i ett til åtte shards (se høyre kolonne i bildet ovenfor).
Etterhvert som antall shards økte, steg utilbøyeligheten jevnt, og bekreftet at selv små økninger i omgangstelling gjorde modellene mer ustabile. Evnen forble stort sett uendret, og understreket at problemet ligger i konsekvens, ikke evne.
Temperaturkontroll
En separat sett med eksperimenter testet om utilbøyelighet bare var et biprodukt av tilfeldighet. For å gjøre dette, varierte forfatterne temperaturinnstillingen for både assistenten og bruker-simulator over tre verdier: 1,0, 0,5 og 0,0.
I enkelt-omgangsformater som full og concat forbedret reduksjon av assistentens temperatur påliteligheten betydelig, og kutte variasjonen med opptil 80 prosent; men i den sharded-innstillingen hadde samme inngripen liten effekt:

Utilbøyelighetsscore for ulike kombinasjoner av assistent- og bruker-temperatur over full, concat og sharded-innstilling. Lavere verdier indikerer større svar-konsistens.
Selv når både assistenten og brukeren var satt til null temperatur, forble utilbøyeligheten høy, med GPT-4o som viste variasjon rundt 30 prosent, og antydet at ustabiliteten sett i multi-omgangssamtaler ikke bare skyldes stokastisk støy, men en strukturell svakhet i hvordan modeller håndterer fragmentert input.
Konsekvenser
Forfatterne skriver om konsekvensene av funnene på en usedvanlig lengde i rapportens konklusjon, og argumenterer for at sterk enkelt-omgangsytelse ikke garanterer multi-omgangspålitelighet, og advarer mot å over-gjøre på fullstendig angitte benchmark-tester når man vurderer virkelige anvendelser (siden slike tester maskerer ustabilitet i mer naturlige, fragmenterte interaksjoner).
De foreslår også at utilbøyelighet ikke bare er et stikprøve-arterefakt, men en grunnleggende begrensning i hvordan nåværende modeller prosesserer utviklende input, og de antyder at dette øker bekymringer for agent-rammeverk, som avhenger av vedvarende resonemang over omganger.
Til slutt argumenterer de for at multi-omgangsevne bør behandles som en kjerne-egenskap i LLM-er, og ikke noe som kan lastes over på eksterne systemer.
Forfatterne merker at deres resultater sannsynligvis underskattet den sanne skalaen av problemet, og trekker oppmerksomheten til de ideelle forholdene i testen: bruker-simulatorn i deres oppsett hadde full tilgang til instruksjonen og kunne avsløre shards i en optimal rekkefølge, noe som ga assistenten en urealistisk gunstig kontekst (i virkelige anvendelser gir brukere ofte fragmenterte eller tvetydige prompter uten å vite hva modellen trenger å høre neste).
I tillegg ble assistenten evaluert umiddelbart etter hver omgang, før hele samtalen utviklet seg, og hindret senere forvirring eller selv-motstridende fra å bli straffet, noe som ellers ville forverret ytelsen. Disse valgene, selv om de var nødvendige for eksperimentell kontroll, betyr at pålitelighetsgapene observert i praksis sannsynligvis vil være enda større enn de rapporterte.
De konkluderer:
‘[Vi] tror at gjennomførte simuleringer representerer en harmløs testarena for LLM-ers multi-omgangsevner. Fordi de overforente testforholdene er for enkle, tror vi at forringelsen observert i eksperimentene sannsynligvis er en underskattelse av LLM-ers utilbøyelighet, og hvor ofte LLM-er blir tapt i samtalen i virkelige settinger.‘
Konklusjon
Hver person som har tilbragt en betydelig mengde tid med en LLM, vil sannsynligvis gjenkjenne problemene formulert her, fra praktisk erfaring; og de fleste av oss, tenker jeg, har intuitivt forlatt ‘tapt’ LLM-samtaler for nye, i håp om at LLM-en kan ‘starte på nytt’ og slutte å besette seg med materiale som kom opp i en lang, vindende og stadig mer irriterende utveksling.
Det er interessant å merke at å kaste mer kontekst på problemet kanskje ikke nødvendigvis løser det; og faktisk å observere at rapporten reiser flere spørsmål enn den gir svar på (bortsett fra måter å hoppe over problemet).
* Forvirrende, dette er ikke relatert til den konvensjonelle betydningen av ‘sharding’ i AI.
† Forfatterens egne fet skrifttyper.
Først publisert mandag, 12. mai 2025












