Liderzy opinii

Problem pamięci AI: Dlaczego wydajna długa kontekst zmienia wszystko, i co jest potrzebne, aby to osiągnąć

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Koledzy, ktÃģrzy zapomnieli kaÅždą poprzednią rozmowę w momencie jej zakończenia, nie przetrwaliby długo w większości prac. Jednak wiele firm AI działa dokładnie w ten sposÃģb. Sesja zostaje zamknięta, a kontekst znika wraz z nią. Konsument, ktÃģry wysyła jednorazowe pytania, moÅže tego nawet nie zauwaÅžyć, ale firma prowadząca proces, ktÃģry trwa dłuÅžej niÅž jedną sesję, natyka się na ograniczenie prawie natychmiast.

Prawdziwa praca jest kontynuowana z jednej sesji na następną, a decyzja podjęta w czwartek zwykle opiera się na decyzji podjętej w poniedziałek, z myślą, ktÃģra musi przetrwać między nimi. AI, ktÃģra czyści się, gdy sesja zostaje zamknięta, moÅže działać dobrze wewnątrz sesji i nadal nie wnosić nic do zadania trwającego przez tydzień.

Firma AI zmieniła cicho, czego wymaga od modelu. Przez lata modele były oceniane głÃģwnie pod kątem ilości wchłoniętej wiedzy. Teraz firmy potrzebują, aby utrzymywały odpowiednią informację na widoku, gdy praca się rozwija, co wymaga innego rodzaju wydajnej inÅžynierii. Do tej pory zdolność do utrzymania tego poziomu trwałej wiedzy nie została osiągnięta z powodu duÅžej ilości pamięci (GPU), obliczeń i kosztÃģw wymaganych do skalowania takiej funkcjonalności. Utrzymanie akceptowalnej opÃģÅšnienia i poziomu halucynacji modelu staje się wyzwaniem przy jednoczesnym uÅžyciu, gdy uÅžywana jest duÅža kontekst. Rosnące zapotrzebowanie na takie moÅžliwości wiedzy i niewystarczająca ilość pamięci i obliczeń. To rodzi pytanie: jak osiągnąć bardziej dokładną inteligencję w skali z mniejszą infrastrukturą i śladem?

Biurko i szafka

Dwie rzeczy są łączone pod hasłem pamięci, a zachowują się wystarczająco inaczej, aby reszta zaleÅžała od ich rozrÃģÅžnienia.

Zacznijmy od okna kontekstowego, ktÃģre określa, ile model moÅže wchłonąć i rozwaÅžyć w jednej sesji. Działa jak powierzchnia biurka. Małe biurko przyjmuje kilka stron na raz, więc wszystko inne czeka w szufladzie i jest pobierane i czyści się, gdy przechodzisz, podczas gdy duÅže biurko pozwala na otwarcie całej teczki jednocześnie, gdy pracujesz nad nią. To, co biurko trzyma, zostaje zmiotane na koniec dnia, kaÅždego dnia.

Trwała pamięć to szafka obok biurka. System wybiera, co przechowywać, i wyjmuje to, co staje się istotne, więc coś, co wydarzyło się w tym tygodniu, moÅže poinformować, co robi w następnym tygodniu. To przechowywanie przenosi się między sesjami i wymaga własnych decyzji o tym, co zachować, jak to zorganizować i kiedy to przywrÃģcić.

Większość widocznych prac inÅžynierskich została ukierunkowana na biurko. Okna, ktÃģre kiedyś trzymały kilka tysięcy tokenÃģw, teraz sięgają setek tysięcy, a największe modele od OpenAI i Anthropic sięgają miliona.

Termin tej pracy, “inÅžynieria kontekstowa”, pochodzi od Tobi Lutke ze Shopify i został spopularyzowany przez Andreja Karpathy’ego w połowie 2025 roku. Podstawową umiejętnością w kaÅždej powaÅžnej aplikacji AI jest wypełnienie okna odpowiednią informacją do następnego kroku. Jego analogia była sprzętowa – model jako procesor, okno jako pamięć robocza. Praktycy szybko przyjęli ten termin, poniewaÅž krÄ…Åžyli wokÃģł tej idei bez etykiety.

Posiadanie większego biurka nie rozwiązuje problemu pamięci

To jest miejsce, w ktÃģrym oczywisty ruch – po prostu powiększanie biurka – napotyka na trudności.

Badacze z Stanfordu wykazali w 2024 roku , Åže gdy informacja, ktÃģrej model potrzebuje, znajduje się w środku długiego wejścia, jego dokładność spada ostro w porÃģwnaniu z tą samą informacją umieszczoną na początku lub na końcu. Nazwali to “zagubionym w środku”, a to utrzymywało się nawet dla modeli specjalnie zaprojektowanych dla długiej kontekst. Umieszczenie większej ilości informacji przed modelem okazało się nie być tym samym, co niezawodne korzystanie z niej.

Ten efekt utrzymał się, gdy inne zespoły szukały go, a badanie z 2025 roku, ktÃģre przetestowało 18 modeli przeciwko coraz dłuÅžszym wejściom, wykazało pogorszenie wynikÃģw jeszcze zanim okno było wypełnione , co autorzy nazwali “kontekstową gnicie”. Zwiększanie biurka i uzyskanie modelu, ktÃģry czysto rozwaÅža wszystko na nim, to dwa oddzielne problemy, a pierwszy nie rozwiązuje drugiego.

Kuracyjność zarabia więcej niÅž pojemność

InÅžynieria kontekstowa rozwinęła się w dyscyplinę na podstawie tego, z badaniem z 2025 roku, ktÃģre opierało się na ponad 1400 pracach , ktÃģre przedstawiły swoje metody, a Gartner doradzał klientom w lipcu 2025 roku, aby priorytetem było kontekst nad podpowiedziami . Rzemiosło przeszło od sformułowania ostrzejszej instrukcji do zmontowania ostrzejszego zestawu danych wejściowych dla modelu do pracy.

Większe biurko zwiększa stawkę tego, co umieścisz na nim. Przelew całego magazynu dokumentÃģw na powierzchnię i kilka stron, ktÃģre mają znaczenie, kończy się utratą wśrÃģd szumu, sprzeczności i przestarzałych wersji, podczas gdy ściślejszy wybÃģr tego, co naprawdę dotyczy zadania, pozwala temu samemu modelowi działać znacznie lepiej. Sąd o tym, co naleÅžy umieścić przed modelem, jak to umieścić, kiedy to umieścić i co pozostawić w szafce.

To właśnie do tego celu została zbudowana RAG (retrieval-Augmented Generation): rozcinanie dokumentÃģw na fragmenty i pobieranie tych, ktÃģre wydają się istotne, aby ominąć okno, ktÃģre jest za małe, aby pomieścić całość. Powiedzmy, Åže spÃģr kontraktowy zaleÅžy od jednej klauzuli na stronie 200. Zwykłe podejście rozcinuje kontrakt na fragmenty i pozwala systemowi pobrać te, ktÃģre wydają się istotne. Ocena strony 200 jako nieistotna powoduje, Åže model nigdy nie zobaczy klauzuli.

Okno dostosowane do całego kontraktu omija całkowicie krok pobierania i daje modelowi klauzulę wraz z wszystkim wokÃģł niej. Czy model potem czyta długi tekst dobrze, jest to problem niezawodności z poprzedniej sekcji, i jest to lepszy problem, z ktÃģrym moÅžna zostać niÅž system pobierania, ktÃģry cicho decyduje, Åže klauzula nie jest warta przekazania.

Wewnątrz sesji i po niej

Długa kontekst pozwala agentowi AI pracować nad długim zadaniem, a nie tylko jedną wymianą. Agent obsługujący wielodniową kontrolę zgodności lub wdroÅženie dostawcy utrzymuje całe zadanie w oknie, gdy jest uruchomiony, więc kaÅždy krok opiera się na pełnym stanie zadania. Długa kontekst moÅže zastąpić pamięć wewnątrz sesji.

To rÃģwnieÅž tam, gdzie podobieństwo się kończy. Cokolwiek system powinien przypomnieć w następnym tygodniu, gdy ta sesja zostanie zamknięta, musi mieszkać gdzieś, gdzie okno nie jest.

Budowanie tego rodzaju pamięci przynosi inny zestaw problemÃģw, z ktÃģrymi branÅža dopiero zaczyna się mierzyć. Moje szkolenie w psychologii i neurologii sprawia, Åže porÃģwnanie z pamięcią ludzką jest trudne do pominięcia. Nie odtwarzamy idealnej kopii zdarzenia. KaÅždy raz, gdy je przypominamy, odbudowujemy je, a małe błędy mogą stopniowo stać się częścią akceptowanej wersji. Pamięć maszyny moÅže rozwinąć podobny problem, gdy przechowywana informacja jest wielokrotnie podsumowywana, scalana lub przepisywana. Z czasem zapis moÅže oddalić się od oryginalnego zdarzenia, chyba Åže ktoś to sprawdzi, poprawi błędy i usunie informacje, ktÃģre stały się niewiarygodne.

Wiele firm wdroÅžonych tych systemÃģw jeszcze nie napotkało tych problemÃģw, a niewiele jest blisko rozwiązania. To, na co zwrÃģcę uwagę u dostawcy, to nie rozmiar okna, ktÃģre reklamuje. Model, ktÃģry trzyma 10 milionÃģw tokenÃģw, jest wart mało, jeśli większość tego, co trzyma, jest przestarzała, nieistotna lub błędna. Jego odpowiedzi mogą wyglądać dobrze udokumentowane, opierając się na materiale, ktÃģrego firma nigdy nie powinna była ufać. To, co zarabia pieniądze, to osąd o tym, co zachować, i umiejętność dokładnego rozwaÅžania wszystkich informacji, przy ułamku kosztÃģw infrastruktury i śladu. To jest robienie więcej z mniej, a nie wszystkie większe okna posiadają tę prawdziwą zdolność.

Mathew Haswell jest wspÃģłzałoÅžycielem Refiant, firmy zajmującej się efektywną sztuczną inteligencją, kompresją i czynieniem modeli bardziej efektywnymi i praktycznymi do wdroÅženia, w tym długiego kontekstu. Magister nauk medycznych i neuronaukowiec w zakresie szkolenia, pełnił strategiczne role wykonawcze, biznesowe, operacyjne i produkcyjne w branÅžach technologicznych, fintech, gier, handlu detalicznego i usług finansowych

OgÃģlnie, chciałbym, abyśmy skupili się bardziej na tym, jak mamy nowatorskie podejście do efektywności sztucznej inteligencji, ktÃģre umoÅžliwia długi kontekst przy uÅžyciu ułamka obliczeń i pamięci.