Tankeledare

AI:s minnesproblem: Varför effektiv lång kontext förändrar allt, och vad som krävs för att göra det rätt

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En kollega som glömde varje tidigare konversation så fort den avslutades skulle inte överleva länge på de flesta jobb. Ändå fungerar mycket affärs-AI på precis samma sätt. Sessionen stängs och kontexten försvinner med den. En konsument som skickar enstaka frågor kanske knappt märker det, men ett företag som kör en process som varar längre än en enda sittning når gränsen nästan omedelbart.

Riktigt arbete fortsätter från en session till nästa, och ett beslut som fattas på torsdagen beror vanligtvis på ett beslut som fattades på måndagen, med tanke på att det behöver överleva däremellan. En AI som suddar ut sig själv när en session avslutas kan fungera bra inom den sessionen och ändå bidra med ingenting till en uppgift som pågår under en vecka.

Företags-AI har tyst förändrat vad det kräver av en modell. Under många år har modeller till stor del bedömts utifrån hur mycket kunskap de har absorberat. Företag behöver nu att de ska hålla rätt information i sikte medan arbetet utvecklas, en förmåga som kräver en annan typ av effektiv ingenjörskonst. Hittills har förmågan att hålla denna nivå av beständig kunskap inte uppnåtts på grund av den stora mängden minne (GPU:er), beräkningar och kostnader som krävs för att skala upp en sådan förmåga. Att upprätthålla en acceptabel latens och nivå av modellhallucinationer blir en utmaning med samtidig användning när en stor kontext används. Det finns en ökande efterfrågan på sådana kunskapsförmågor och inte tillräckligt med minne och beräkningskraft för att täcka det. Så detta väcker frågan: hur uppnår man mer exakt intelligens i stor skala med mindre infrastruktur och avtryck?

Skrivbordet och arkivskåpet

Två saker som hamnar under rubriken minne och de beter sig tillräckligt annorlunda för att resten av detta beror på att hålla dem isär.

Börja med kontextfönstret, som är hur mycket en modell kan ta in och resonera över i ett enda steg. Det fungerar som ytan på ett skrivbord. Ett litet tar in några sidor i taget, så allt annat väntar i en låda och hämtas och rensas när man går, medan ett stort låter hela ärendet ligga öppet på en gång medan man arbetar över det. Vad skrivbordet håller sopas bort i slutet av dagen, varje dag.

Beständigt minne är arkivskåpet bredvid skrivbordet. Systemet väljer vad som ska lagras och hämtar det tillbaka när det blir relevant, så något som hände den här veckan kan informera vad det gör nästa vecka. Det lagret sträcker sig över sessioner och det behöver sina egna beslut om vad som ska sparas, hur det ska organiseras och när det ska hämtas tillbaka.

Mycket av den synliga ingenjörskonsten har gått till skrivbordet. Fönster som tidigare höll några tusen token sträcker sig nu till hundratusentals, och de största modellerna från OpenAI och Anthropic toppar ut runt en miljon.

Begreppet för detta arbete, ‘kontextteknik’, kom från Shopifys Tobi Lutke och populariserades av Andrej Karpathy i mitten av 2025. Den centrala färdigheten i alla allvarliga AI-tillämpningar är att fylla fönstret med rätt information för nästa steg, skrev Karpathy. Hans analogi var hårdvara – modellen som processor, fönstret som dess arbetsminne. Utövare antog begreppet snabbt, eftersom de hade cirklat runt idén utan en etikett för det.

Att ha ett större skrivbord löser inte minnesproblemet

Här är där den uppenbara rörelsen – att bara fortsätta utöka skrivbordet – springer in i problem.

Stanford-forskare visade 2024 att när informationen en modell behöver sitter mitt i en lång inmatning, sjunker dess noggrannhet skarpt mot samma faktum placerat i början eller slutet. De kallade det ‘förlorat i mitten’, och det gällde även för modeller som var särskilt utformade för lång kontext. Att lägga till mer information framför en modell visar sig inte vara detsamma som att modellen använder den tillförlitligt.

Effekten har hållit i sig när andra team har letat efter det, och en studie från 2025 som körde 18 frontmodeller mot allt längre inmatningar fann att prestandan försämrades långt innan fönstret ens var fullt, ett mönster som dess författare kallade kontextrot. Att utöka skrivbordet och få en modell att resonera rent över allt på det är två separata problem, och det första löser inte det andra.

Kurering ger mer än kapacitet

Kontextteknik har vuxit till en disciplin på grund av detta, med en undersökning från 2025 som byggde på mer än 1 400 artiklar som fastställde dess metoder och Gartner som rådde klienter i juli 2025 att prioritera kontext framför uppmaningar. Hantverket gick vidare från att formulera en skarpare instruktion till att sammanställa en skarpare uppsättning inmatningar för modellen att arbeta från. (SHOP )

En större skrivbord höjer insatsen på vad man väljer att lägga på det. Att hälla ut en hel dokumentbutik på ytan och de få sidor som verkligen betyder något hamnar förlorade bland brus, motsägelser och föråldrade versioner, medan ett snävare urval av vad som faktiskt påverkar uppgiften låter samma modell prestera markant bättre. Domarna ligger i vad som hör till framför modellen, hur det är ramat, när det visas och vad som stannar i skåpet.

Detta är vad RAG (retrieval-Augmented Generation) byggdes för: att dela dokument i fragment och hämta de som ser relevanta, för att komma runt ett fönster som är för litet för att hålla hela dokumentet. Säg att en kontraktstvist handlar om en klausul på sida 200. Den vanliga metoden delar kontraktet i fragment och låter ett hämtningsystem hämta vilka som verkar relevanta. Om man bedömer sida 200 som irrelevant ser modellen aldrig klausulen.

Ett fönster som är tillräckligt stort för hela kontraktet hoppar över hämtningssteget helt och ger modellen klausulen tillsammans med allt runt omkring. Om modellen sedan läser en lång inmatning väl är det tillförlitlighetsproblemet från den tidigare avsnittet, och det är ett bättre problem att ha kvar än ett hämtningsystem som tyst bestämmer att klausulen inte var värd att lämna över.

Inom en session och efter den

Lång kontext är vad som låter en AI-agent arbeta över en lång uppgift snarare än en enda utbyte. En agent som hanterar en flerdagars regelefterlevnadsgranskning eller en leverantörsregistrering håller hela uppgiften i fönstret medan den körs, så varje steg bygger på hela uppgiftens tillstånd. Ett tillräckligt stort fönster kan ersätta minne inom en session.

Det är också där likheten slutar. Vad systemet borde komma ihåg nästa vecka, när den här sessionen har stängts, måste bo någonstans fönstret inte är.

Att bygga den typen av minne medför en annan uppsättning problem, många av vilka branschen bara har börjat konfrontera. Min utbildning i psykologi och neurovetenskap gör jämförelsen med mänskligt minne svår att missa. Vi hämtar inte en perfekt inspelning av en händelse. Varje gång vi minns den bygger vi om den, och små fel kan gradvis bli en del av den accepterade versionen. Ett maskinminne kan utveckla ett liknande problem när lagrad information sammanfogas, sammanfogas eller omformuleras om och om igen. Med tiden kan posten flytta sig längre ifrån den ursprungliga händelsen såvida någon inte kontrollerar den, rättar till fel och tar bort information som har blivit opålitlig.

Många företag som distribuerar dessa system har inte nått dessa problem ännu, och få är nära en lösning. Vad jag skulle titta på hos en leverantör är inte storleken på fönstret de annonserar. En modell som håller 10 miljoner token är värd lite om det mesta den behåller är föråldrat, irrelevant eller fel. Dess svar kan se välinformerade ut medan de vilar på material som företaget aldrig borde ha litat på. Vad som tjänar pengar är domen om vad som ska behållas och förmågan att exakt resonera över all information, på en bråkdel av infrastrukturkostnaden och avtrycket. Det är att göra mer med mindre, och inte alla större fönster kommer med denna sanna förmåga.

Källor från originalartikeln: x.com [1] · arxiv.org [2] · research.trychroma.com [3] · arxiv.org [4] · gartner.com [5]

Mathew Haswell är medgrundare till Refiant, ett AI-företag som fokuserar på effektiv AI, komprimering och gör modeller mer effektiva och praktiska att distribuera, inklusive lång kontext. Med en masterexamen i medicinsk vetenskap och neurovetenskap som utbildning, har han haft strategiska ledande, affärs-, drifts- och produktroller inom teknik, fintech, spel, detaljhandel och finansiella tjänsteföretag.