Liderzy opinii

Problem pamięci AI: Dlaczego wydajna długa kontekst zmienia wszystko, i co jest potrzebne, aby to osiągnąć

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Koledzy, którzy zapomnieli każdą poprzednią rozmowę w momencie jej zakończenia, nie przetrwaliby długo w większości prac. Jednak wiele firm AI działa dokładnie w ten sposób. Sesja zostaje zamknięta, a kontekst znika wraz z nią. Konsument, który wysyła jednorazowe pytania, może tego nawet nie zauważyć, ale firma prowadząca proces, który trwa dłużej niż jedną sesję, natyka się na ograniczenie prawie natychmiast.

Prawdziwa praca jest kontynuowana z jednej sesji na następną, a decyzja podjęta w czwartek zwykle opiera się na decyzji podjętej w poniedziałek, z myślą, która musi przetrwać między nimi. AI, która czyści się, gdy sesja zostaje zamknięta, może działać dobrze wewnątrz sesji i nadal nie wnosić nic do zadania trwającego przez tydzień.

Firma AI zmieniła cicho, czego wymaga od modelu. Przez lata modele były oceniane głównie pod kątem ilości wchłoniętej wiedzy. Teraz firmy potrzebują, aby utrzymywały odpowiednią informację na widoku, gdy praca się rozwija, co wymaga innego rodzaju wydajnej inżynierii. Do tej pory zdolność do utrzymania tego poziomu trwałej wiedzy nie została osiągnięta z powodu dużej ilości pamięci (GPU), obliczeń i kosztów wymaganych do skalowania takiej funkcjonalności. Utrzymanie akceptowalnej opóźnienia i poziomu halucynacji modelu staje się wyzwaniem przy jednoczesnym użyciu, gdy używana jest duża kontekst. Rosnące zapotrzebowanie na takie możliwości wiedzy i niewystarczająca ilość pamięci i obliczeń. To rodzi pytanie: jak osiągnąć bardziej dokładną inteligencję w skali z mniejszą infrastrukturą i śladem?

Biurko i szafka

Dwie rzeczy są łączone pod hasłem pamięci, a zachowują się wystarczająco inaczej, aby reszta zależała od ich rozróżnienia.

Zacznijmy od okna kontekstowego, które określa, ile model może wchłonąć i rozważyć w jednej sesji. Działa jak powierzchnia biurka. Małe biurko przyjmuje kilka stron na raz, więc wszystko inne czeka w szufladzie i jest pobierane i czyści się, gdy przechodzisz, podczas gdy duże biurko pozwala na otwarcie całej teczki jednocześnie, gdy pracujesz nad nią. To, co biurko trzyma, zostaje zmiotane na koniec dnia, każdego dnia.

Trwała pamięć to szafka obok biurka. System wybiera, co przechowywać, i wyjmuje to, co staje się istotne, więc coś, co wydarzyło się w tym tygodniu, może poinformować, co robi w następnym tygodniu. To przechowywanie przenosi się między sesjami i wymaga własnych decyzji o tym, co zachować, jak to zorganizować i kiedy to przywrócić.

Większość widocznych prac inżynierskich została ukierunkowana na biurko. Okna, które kiedyś trzymały kilka tysięcy tokenów, teraz sięgają setek tysięcy, a największe modele od OpenAI i Anthropic sięgają miliona.

Termin tej pracy, “inżynieria kontekstowa”, pochodzi od Tobi Lutke ze Shopify (SHOP ) i został spopularyzowany przez Andreja Karpathy’ego w połowie 2025 roku. Podstawową umiejętnością w każdej poważnej aplikacji AI jest wypełnienie okna odpowiednią informacją do następnego kroku. Jego analogia była sprzętowa – model jako procesor, okno jako pamięć robocza. Praktycy szybko przyjęli ten termin, ponieważ krążyli wokół tej idei bez etykiety.

Posiadanie większego biurka nie rozwiązuje problemu pamięci

To jest miejsce, w którym oczywisty ruch – po prostu powiększanie biurka – napotyka na trudności.

Badacze z Stanfordu wykazali w 2024 roku , że gdy informacja, której model potrzebuje, znajduje się w środku długiego wejścia, jego dokładność spada ostro w porównaniu z tą samą informacją umieszczoną na początku lub na końcu. Nazwali to “zagubionym w środku”, a to utrzymywało się nawet dla modeli specjalnie zaprojektowanych dla długiej kontekst. Umieszczenie większej ilości informacji przed modelem okazało się nie być tym samym, co niezawodne korzystanie z niej.

Ten efekt utrzymał się, gdy inne zespoły szukały go, a badanie z 2025 roku, które przetestowało 18 modeli przeciwko coraz dłuższym wejściom, wykazało pogorszenie wyników jeszcze zanim okno było wypełnione , co autorzy nazwali “kontekstową gnicie”. Zwiększanie biurka i uzyskanie modelu, który czysto rozważa wszystko na nim, to dwa oddzielne problemy, a pierwszy nie rozwiązuje drugiego.

Kuracyjność zarabia więcej niż pojemność

Inżynieria kontekstowa rozwinęła się w dyscyplinę na podstawie tego, z badaniem z 2025 roku, które opierało się na ponad 1400 pracach , które przedstawiły swoje metody, a Gartner doradzał klientom w lipcu 2025 roku, aby priorytetem było kontekst nad podpowiedziami . Rzemiosło przeszło od sformułowania ostrzejszej instrukcji do zmontowania ostrzejszego zestawu danych wejściowych dla modelu do pracy.

Większe biurko zwiększa stawkę tego, co umieścisz na nim. Przelew całego magazynu dokumentów na powierzchnię i kilka stron, które mają znaczenie, kończy się utratą wśród szumu, sprzeczności i przestarzałych wersji, podczas gdy ściślejszy wybór tego, co naprawdę dotyczy zadania, pozwala temu samemu modelowi działać znacznie lepiej. Sąd o tym, co należy umieścić przed modelem, jak to umieścić, kiedy to umieścić i co pozostawić w szafce.

To właśnie do tego celu została zbudowana RAG (retrieval-Augmented Generation): rozcinanie dokumentów na fragmenty i pobieranie tych, które wydają się istotne, aby ominąć okno, które jest za małe, aby pomieścić całość. Powiedzmy, że spór kontraktowy zależy od jednej klauzuli na stronie 200. Zwykłe podejście rozcinuje kontrakt na fragmenty i pozwala systemowi pobrać te, które wydają się istotne. Ocena strony 200 jako nieistotna powoduje, że model nigdy nie zobaczy klauzuli.

Okno dostosowane do całego kontraktu omija całkowicie krok pobierania i daje modelowi klauzulę wraz z wszystkim wokół niej. Czy model potem czyta długi tekst dobrze, jest to problem niezawodności z poprzedniej sekcji, i jest to lepszy problem, z którym można zostać niż system pobierania, który cicho decyduje, że klauzula nie jest warta przekazania.

Wewnątrz sesji i po niej

Długa kontekst pozwala agentowi AI pracować nad długim zadaniem, a nie tylko jedną wymianą. Agent obsługujący wielodniową kontrolę zgodności lub wdrożenie dostawcy utrzymuje całe zadanie w oknie, gdy jest uruchomiony, więc każdy krok opiera się na pełnym stanie zadania. Długa kontekst może zastąpić pamięć wewnątrz sesji.

To również tam, gdzie podobieństwo się kończy. Cokolwiek system powinien przypomnieć w następnym tygodniu, gdy ta sesja zostanie zamknięta, musi mieszkać gdzieś, gdzie okno nie jest.

Budowanie tego rodzaju pamięci przynosi inny zestaw problemów, z którymi branża dopiero zaczyna się mierzyć. Moje szkolenie w psychologii i neurologii sprawia, że porównanie z pamięcią ludzką jest trudne do pominięcia. Nie odtwarzamy idealnej kopii zdarzenia. Każdy raz, gdy je przypominamy, odbudowujemy je, a małe błędy mogą stopniowo stać się częścią akceptowanej wersji. Pamięć maszyny może rozwinąć podobny problem, gdy przechowywana informacja jest wielokrotnie podsumowywana, scalana lub przepisywana. Z czasem zapis może oddalić się od oryginalnego zdarzenia, chyba że ktoś to sprawdzi, poprawi błędy i usunie informacje, które stały się niewiarygodne.

Wiele firm wdrożonych tych systemów jeszcze nie napotkało tych problemów, a niewiele jest blisko rozwiązania. To, na co zwrócę uwagę u dostawcy, to nie rozmiar okna, które reklamuje. Model, który trzyma 10 milionów tokenów, jest wart mało, jeśli większość tego, co trzyma, jest przestarzała, nieistotna lub błędna. Jego odpowiedzi mogą wyglądać dobrze udokumentowane, opierając się na materiale, którego firma nigdy nie powinna była ufać. To, co zarabia pieniądze, to osąd o tym, co zachować, i umiejętność dokładnego rozważania wszystkich informacji, przy ułamku kosztów infrastruktury i śladu. To jest robienie więcej z mniej, a nie wszystkie większe okna posiadają tę prawdziwą zdolność.

Źródła artykułu oryginalnego: gartner.com [1]

Mathew Haswell jest współzałożycielem Refiant, firmy AI zajmującej się efektywnym AI, kompresją i tworzeniem modeli, które są bardziej efektywne i praktyczne w wdrożeniu, w tym długiego kontekstu. Jako magister nauk medycznych i neuronaukowiec ze szkolenia, pełnił strategiczne role wykonawcze, biznesowe, operacyjne i produkcyjne w firmach technologicznych, fintech, gaming, detalicznych i usług finansowych.