Myslitelé

Problém AI s pamětí: Proč efektivní dlouhý kontext mění všechno a co je potřeba k jeho dosažení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Kolega, který zapomněl každou předchozí konverzaci okamžitě po jejím skončení, by nevydržel dlouho v většině pracovních pozic. Přesto mnoho obchodních AI funguje přesně tímto způsobem. Relace se ukončí a kontext zmizí s ní. Spotřebitel, který posílá jednorázové otázky, si možná téměř nevšimne, ale společnost, která provozuje proces, který trvá déle než jedna sezení, narazí na limit téměř okamžitě.

Skutečná práce pokračuje z jednoho sezení do dalšího a rozhodnutí učiněné ve čtvrtek obvykle závisí na rozhodnutí učiněném v pondělí, s tím, že myšlení za ním musí přežít mezitím. AI, která se sama vyčistí, když sezení skončí, může fungovat dobře uvnitř sezení a přesto nepřispět k úkolu, který trvá déle než týden.

Podniková AI tiše změnila to, co od modelu vyžaduje. Během let byly modely hodnoceny převážně podle množství znalostí, které absorbovaly. Společnosti nyní potřebují, aby si uchovaly správné informace na očích, jak práce postupuje, a to vyžaduje jiný druh efektivní techniky. Dosud nebyla dosažena schopnost udržet tento level trvalých znalostí kvůli velké množství paměti (GPU), výpočetnímu výkonu a nákladům na škálování této schopnosti. Udržování přijatelné latence a úrovně modelové halucinace se stává výzvou při současném použití, když se využívá velká kontextová závislost. Existuje rostoucí poptávka po takových znalostech a není dostatek paměti a výpočetního výkonu. To tedy vyvolává otázku: jak dosáhnout přesnější inteligence ve větším měřítku s menším infrastrukturním nákladem a stopou?

Stůl a šanon

Dvě věci se spojují pod názvem paměť a chovají se dostatečně odlišně, aby zbytek závisel na jejich oddělení.

Začneme s kontextovým oknem, které je tím, kolik model může přijmout a přemýšlet o něm v jednom kroku. Funkcionuje to jako povrch stolu. Malý stůl zpracovává několik stránek najednou, takže všechno ostatní čeká v zásuvce a je načteno a vyčištěno, zatímco velký stůl umožňuje mít celý případný soubor otevřený najednou, zatímco na něm pracujete. Co je na stole, je setřeno na konci dne, každý den.

Trvalá paměť je šanon vedle stolu. Systém si vybírá, co uložit, a znovu jej načte, když se stane relevantním, takže něco, co se stalo tento týden, může ovlivnit, co udělá příští týden. Tento úložný prostor přetrvává napříč sezeními a vyžaduje své vlastní rozhodnutí o tom, co uložit, jak ho uspořádat a kdy ho znovu načíst.

Velká část viditelné inženýrské soutěže se soustředila na stůl. Okna, která dříve držela několik tisíc tokenů, nyní zpracovávají stovky tisíc, a největší modely od OpenAI a Anthropic dosahují maximálně milionu.

Termín pro tuto práci, „kontextová inženýrství“, pocházel od Tobiho Lutkeho ze Shopify (SHOP ) a byl popularizován Andrejem Karpathym v polovině roku 2025. Základní dovedností v jakékoli vážné aplikaci AI, napsal Karpathy, je naplnění okna správnými informacemi pro další krok. Jeho analogie byla hardwarová – model jako procesor, okno jako jeho pracovní paměť. Praktici přijali termín rychle, protože již dlouho obcházeli tuto myšlenku bez označení.

Mít větší stůl nevyřeší problém paměti

Zde je místo, kde zjevný krok – prostě zvětšit stůl – narazí na potíže.

Vědci ze Stanfordu ukázali v roce 2024, že když informace, které model potřebuje, leží uprostřed dlouhého vstupu, jeho přesnost prudce klesá proti stejnému faktu umístěnému na začátku nebo konci. Nazvali to „ztracený uprostřed“ a platilo to i pro modely speciálně navržené pro dlouhý kontext. Umístění více informací před model se ukázalo jako něco jiného, než když model spolehlivě využívá tyto informace.

Tento efekt se udržel, když jiné týmy šly hledat ho, a studie z roku 2025, která běžela 18 modelů na hranici proti postupně delším vstupům, našla degradaci výkonu již dlouho předtím, než bylo okno dokonce plné, což nazvali kontextovou degradací. Zvětšení stolu a získání modelu, aby čistě přemýšlel nad vším na něm, jsou dva samostatné problémy, a první nic neřeší druhý.

Kurátorská činnost vydělává více než kapacita

Kontextová inženýrství se stalo disciplínou na základě tohoto, s průzkumem z roku 2025, který čerpal z více než 1 400 článků, a který stanovil metody a Gartner radil klientům v červenci 2025, aby dávali přednost kontextu před podněty. Remeslo přešlo od formulace ostřejšího pokynu ke sestavení ostřejší sady vstupů pro model, se kterým pracovat.

Větší stůl zvyšuje sázky na to, co na něj umístíte. Přetečením celého dokumentového úložiště na povrch a několika stránek, které skutečně záleží, skončíte ztracenými mezi hlukem, rozpory a zastaralými verzemi, zatímco úžeji vybraná sada toho, co skutečně souvisí s úkolem, umožňuje stejnému modelu fungovat znatelně lépe. Soud leží v tom, co patří před model, jak je rámováno, kdy se objeví a co zůstane ve skříni.

To je to, pro co byl RAG (retrieval-Augmented Generation) postaven: rozdělit dokumenty na fragmenty a načíst ty, které vypadají relevantně, aby se obešlo okno, které je příliš malé na to, aby drželo celou věc. Řekněme, že spor o smlouvu závisí na jedné klauzuli na straně 200. Obvyklý přístup rozdělí smlouvu na fragmenty a nechá systém načíst ty, které vypadají relevantně. Ohodnotí-li stranu 200 jako irelevantní, model nikdy neuvidí klauzuli.

Okno, které je velké enough na to, aby drželo celou smlouvu, úplně vynechá krok načtení a dá modelu klauzuli spolu se vším kolem ní. Zda model pak dobře čte dlouhý vstup, je spolehlivostní problém z předchozí sekce, a je to lepší problém, se kterým být ponechán, než systém načtení, který tiše rozhodne, že klauzule nebyla worth passing along.

Uvnitř sezení a po něm

Dlouhý kontext je to, co umožňuje agentovi AI pracovat napříč dlouhým úkolem, spíše než jedinou výměnou. Agent, který zpracovává více denní kontrolu dodržování předpisů nebo registraci dodavatele, udržuje celý úkol v okně, zatímco běží, takže každá fáze čerpá z celkového stavu úkolu. Dlouhé enough okno může nahradit paměť uvnitř sezení.

To je také místo, kde podobnost končí. Cokoliv by systém měl vzpomenout si na příští týden, poté, co sezení skončilo, musí žít někde, kde okno není.

Vybudování tohoto druhu paměti přináší jiný soubor problémů, se kterými se průmysl teprve začal vyrovnávat. Má školení v psychologii a neurovědě dělá srovnání s lidskou pamětí obtížně přehlédnutelné. My si nevzpomínáme perfektní záznam události. Každýkrát, když si na ni vzpomeneme, znovu ji přestavíme, a malé chyby se mohou postupně stát součástí přijaté verze. Paměť stroje může vyvinout podobný problém, když uložené informace jsou opakovaně shrnuty, sloučeny nebo přepsány. S časem se záznam může vzdálit od původní události, pokud někdo nekontroluje, opravuje chyby a odstraňuje informace, které se staly nespolehlivými.

Mnohé společnosti, které tyto systémy nasazují, ještě nenarazily na tyto problémy a málokterá je blízko k vyřešení. To, na co bych se díval u dodavatele, není velikost okna, kterou inzerují. Model, který drží 10 milionů tokenů, je worth málo, pokud většina toho, co drží, je zastaralá, irelevantní nebo špatná. Jeho odpovědi mohou vypadat dobře zdrojované, zatímco spočívají na materiálu, který by společnost nikdy neměla důvěřovat. To, co vydělává peníze, je úsudek o tom, co si uložit, a schopnost přesně přemýšlet nad všemi informacemi, na zlomek infrastrukturních nákladů a stopy. To je dělat více s méně, a ne všechny větší okna přicházejí s touto skutečnou schopností.

Mathew Haswell je spoluzakladatel společnosti Refiant, která se zaměřuje na efektivní umělou inteligenci, kompresi a vytváření modelů, které jsou efektivnější a praktičtější pro nasazení, včetně dlouhého kontextu. Jako Master of Medical Science a neurovědec má bohaté zkušenosti ve strategických, obchodních, provozních a produktových rolích v technologických, finančních, herních, maloobchodních a finančních službách.