Liderzy opinii

Pamięć Twojej firmy powinna przetrwać jej modele AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Ludzie często pytają, który model napędza moją firmę. Odpowiedź ma znaczenie: określa jakość, koszty i ograniczenia, i chętnie poświęcę na to godzinę. Chcę też wiedzieć drugą rzecz: co organizacja nadal będzie posiadać, gdy ten model się zmieni.

Ustal to jako datę. Jeśli Twój dostawca podwoił cenę we wtorek lub wycofał punkt końcowy, na którym budowałeś, co nadal posiadasz w środę rano?

Dla wielu firm szczera odpowiedź brzmi: klucz API, faktura i bardzo długa historia konwersacji przechowywana na serwerach kogoś innego, według jego harmonogramu przechowywania.

Moje wykształcenie to chemia. Spędziłem lata budując modele szarej skrzynki dla zakładów chemicznych, podłączone do systemu SCADA, wyników laboratoryjnych i notatek operatora. Ta praca szybko nauczyła jednego reguły: liczba bez swoich warunków nie jest wynikiem. Jeśli ktoś w zeszłym tygodniu wymienił czujnik i nikt tego nie zapisał, odczyt na ekranie nic nie wyjaśnia.

To problem notatnika laboratoryjnego. Teraz pojawia się jako problem zakupowy i rzadko znajduje się w miejscu, gdzie ustala się budżet na AI.

Trzy pytania, które dają jedną odpowiedź

Większe okno kontekstu pozwala modelowi używać więcej informacji w jednej prośbie. Trwałe przechowywanie określa, co przetrwa między żądaniami. Przenośność określa, czy te informacje pozostaną użyteczne, gdy dostawca się zmieni. To są odrębne kwestie architektoniczne, a okno o milionie tokenów skłoniło wszystkich do traktowania ich jako jednej.

Dokumentacja Google oferuje analogję bezpośrednio: “Analogią dla okna kontekstu jest pamięć krótkotrwała.” Weź to dosłownie. Pamięć krótkotrwała to to, co tracisz.

Dlatego każdy dostawca sprzedający ogromne okno oferuje również coś odrębnego do utrwalania stanu. Przeczytaj te warstwy precyzyjnie, w ich własnych słowach, i zanotuj, co dokładnie obejmuje każda z nich.

OpenAI przechowuje obiekty Response domyślnie przez 30 dni; Obiekty konwersacji i ich elementy są zwolnione z tego limitu czasu przechowywania. 30‑dniowe usuwanie Amazonu dotyczy interfejsu API zarządzania sesjami Bedrock i obejmuje wyłącznie to API. Anthropic’s narzędzie pamięci po stronie klienta ilustruje jedną użyteczną granicę: model żąda operacji pamięci, aplikacja kontroluje przechowywanie, podczas gdy ta sama firma również oferuje zarządzane magazyny pamięci dla swoich hostowanych agentów.

Wszystko to są zwykłe decyzje inżynieryjne, publikowane otwarcie. Oznacza to również, że zasady przechowywania kontekstu pracy Twojej firmy znajdują się w notatkach wydawniczych kogoś innego i powinieneś być w stanie wskazać, która zasada dotyczy których danych.

Gdzie naprawdę mieszka koszt przełączania

Zamiana jednego wywołania generowania tekstu na inne zajmuje weekend. Dlatego stwierdzenie „jesteśmy wielomodelowi” jest tak tanie do wypowiedzenia. Drogie warstwy to te, których nikt nie demonstruje.

Osadzenia. Zmiana osadzenie model zazwyczaj wymaga ponownego osadzenia korpusu i migracji lub odbudowy indeksu. Zmiana generacji model nie wymaga takiego wymogu, a dwa są ciągle mylone — zwykle przez tych, którzy obiecują szybką migrację. Literatura z 2025 roku opisuje standardową ścieżkę jako “ponowne kodowanie całego korpusu i odbudowa indeksu Approximate Nearest Neighbor (ANN), prowadząca do znaczących zakłóceń operacyjnych i kosztów obliczeniowych”; własny wkład tego artykułu, Drift-Adapter, to metoda na odkładanie ponowne budowanie poprzez naukę transformacji między przestrzeniami osadzeń. Tak czy inaczej, koszt migracji obejmuje walidację wyszukiwania i prace operacyjne, a także same wywołania osadzeń.

Zachowanie po dostrojeniu. Jedno zdanie z Cohere’s zawiadomienie o wycofaniu z września 2025 należy umieścić nad każdym biurkiem zakupowym: “Poprzednio dostrojone modele nie będą już dostępne.” Zachowanie, za które zapłacono, zostało wycofane wraz z punktem końcowym, który je hostował. Wszyscy podążyli za opublikowanym procesem. Twój model i tak zniknął.

Zachowanie promptów i narzędzi. Te same instrukcje generują inną aplikację na innym modelu. W jednej aplikacji korporacyjnej, badacze zgłosili spadek wskaźnika przejścia regresji z 100 % na oryginalnym modelu do 97,3 % na nowszym, przy identycznych promptach, odzyskano dopiero po celowym przeprojektowaniu promptów. Scenariusze testowe pojawiają się w produkcji z własną częstotliwością, więc ta liczba nie pozwala oszacować, jak często żywe przepływy pracy zawodzą. Zasada operacyjna, którą wspiera, jest prostsza: zweryfikuj każdą aktualizację modelu na poziomie aplikacji, samodzielnie, zanim trafi do klienta.

Wszystko to ostatecznie trafia na fakturę, długo po tym, jak porównano strony cenowe.

Ktoś inny trzyma Twój kalendarz

Wycofywanie odbywa się zgodnie z opublikowanym harmonogramem, a harmonogramy nie są twoje. OpenAI dało roczne wypowiedzenie przed zamknięciem API Asystentów w sierpniu 2026 r. – hojnie w porównaniu ze standardami tej samej strony, gdzie podgląd GPT‑4.5 otrzymał około trzech miesięcy. Polityka Mistrala wynosi sześć miesięcy dla modeli GA i jeden miesiąc dla wersji podglądowych oraz modeli stron trzecich, z ostrzeżeniem, że zmieniający się alias „może narażać cię na ciche aktualizacje zachowania modelu i cen”.

AWS wyraźnie mówi o cichej części w swojej polityce cyklu życia: „Przenieś się do modelu Active przed datą EOL; migracja nie nastąpi automatycznie.”

Twoja mapa drogowa ma współautora. Nigdy nie uczestniczy w twoich spotkaniach planistycznych i nie obchodzi go, w którym kwartale się znajdujesz.

Cena również jest zmienną

W standardowych stawkach Gemini 3.7 Flash, pięć miliardów niebuforowanych tokenów wejściowych i jeden miliard tokenów wyjściowych rozliczanych kosztuje 7 500 $ miesięcznie. Stawki obecnie zaplanowane na 1 stycznia 2027 podwoiłyby rachunek za tokeny do 15 000 $, przed innymi opłatami lub rabatami, podczas gdy twój produkt robi dokładnie to, co robił wcześniej.

Zamrożona lista cen może również spowodować wyższy rachunek. Dokumentacja dokumentacji cen Anthropic wskazuje, że tokenizator używany w nowszych generacjach modeli „generuje około 30 % więcej tokenów przy tym samym tekście” – zależnie od treści i specyficzne dla tych generacji – co sprawia, że wpływ na konkretną fakturę musisz sam zmierzyć. Dlatego zmierz tokeny, za które jesteś rozliczany. Sama karta stawek nie poda ci tej informacji.

Dla produktu obsługującego przepływy pracy użyteczną miarą ekonomiczną jest koszt pomyślnie zakończonego zadania, łącznie z ponownymi próbami i weryfikacją ludzką. Ta wartość zmienia się, gdy model się zmienia, nawet jeśli karta stawek pozostaje niezmieniona.

I nic z tego nie podlega negocjacji, gdy odejście zajmuje rok. Capgemini przeprowadziło badanie 1 300 dyrektorów w organizacjach o wartości miliardów dolarów wiosną 2026 dotyczące krytycznych dostawców technologii: 36 % stwierdziło, że przejście na innego dostawcę zajęłoby ponad dwanaście miesięcy, a każdy dziesiąty nie miał w ogóle realnej alternatywy. To opis relacji z dostawcą bez drugiego źródła.

Przekaż to do działu zakupów

Prowadzę francuską firmę, zarejestrowaną w Marsylii, hostowaną w Europie, i i tak pominę przemowę o suwerenności w abstrakcji. Niezależność od każdego dostawcy technologii jest poza zasięgiem przeciętnej firmy. To samo badanie Capgemini wykazało, że 59 % dyrektorów uważa pełną suwerenność cyfrową za nierealistyczną, i podzielam ich zdanie.

Zrozumienie i kontrola kluczowych zależności to mniejsze, ale możliwe zadanie. Trzy pytania, na które można odpowiedzieć na spotkaniu: gdzie przechowywane i przetwarzane są nasze dane, kto ma do nich dostęp oraz co byłoby potrzebne, aby kontynuować działanie z innym dostawcą?

Każda firma wie, jak zadawać to pytanie w kontekście logistyki, płatności i przechowywania w chmurze. Gdy pytamy o kontekst pracy, zależność europejska pojawia się na spotkaniu jako dyskusja o drugim źródle z podaną liczbą, co jest formą, na którą dział zakupów może zareagować.

Jedna uwaga dotycząca liczb, które tu przytaczają. To, że przedsiębiorstwo korzysta z kilku modeli, niewiele mówi o tym, czy może przenieść swój kontekst pracy między dostawcami. Wymaga to oddzielnego testu: czy rekordy, uprawnienia i nieukończona praca mogą zostać przeniesione i nadal być użyte?

Co tak naprawdę sprawia, że model jest wymienny

Wspólny interfejs między modelami jest przydatny i zbudowałbym go. Powinien uwidaczniać specyficzne dla modelu możliwości i zależności. Przenośność nie wymaga udawania, że każdy model zachowuje się tak samo, a abstrakcja, która spłaszcza różnice, cicho eliminuje powód, dla którego zapłaciłeś za dobry model.

Cięższa praca polega na posiadaniu stanu, którego żaden dostawca nie powinien być jedynym opiekunem. Cztery elementy, w kolejności, w jakiej się psują.

Autorytatywny rekord pod twoją kontrolą. Wiadomości, pobrane źródła, zatwierdzenia, punkty kontrolne wykonania. Zarejestruj, co zostało zakończone w systemach zewnętrznych i co może być bezpiecznie powtórzone: e‑mail mógł zostać wysłany, podczas gdy potwierdzenie nie zostało zapisane, a procedura odzyskiwania, która o tym nie wie, wyśle go dwukrotnie. Każdy stan dostawcy, którego nie możesz odtworzyć, jest zależnością. Zanotuj go jako jedną, wyraźnie, zanim incydent zrobi to za ciebie.

Źródło obok każdego wektora. Wektor to skompilowany artefakt; fragment (chunk) to kod źródłowy. Przechowuj dokument źródłowy i jego wersję, identyfikator dokumentu, granice fragmentu, wersję podziału, model osadzania wraz z wersją i wymiarami, wersję indeksu oraz informacje o przetwarzaniu, które wygenerowało tekst. Sam zapisany fragment tekstu nie odtworzy tabeli, obrazu ani wyniku OCR. Zachowanie wszystkiego zamienia ponowne indeksowanie w planowaną migrację, co jest taką samą wygodą, jaką obiecałbym.

Rekordy rozróżniające źródło, wnioskowanie i decyzję. Pamięć musi oddzielić to, co powiedziało źródło, to, co model wnioskował, i to, co zatwierdziła osoba. Klient obiecujący zapłatę w czwartek, przypuszczenie modelu, że płatność się opóźni, oraz uzgodnione przedłużenie do piątku to trzy różne rekordy o trzech różnych statusach, a system musi wiedzieć, którego może użyć. Każdy wymaga swojego pochodzenia, zakresu, reguł dostępu i bieżącego statusu, w tym informacji, czy został skorygowany lub zastąpiony. Transkrypt może zawierać dowody; odtworzenie go nie identyfikuje wiarygodnie, które wnioski są nadal aktualne, a które decyzje wciąż obowiązują.

Przenośność, którą faktycznie przetestowałeś. Uczyń ją testowalną na dwa sposoby: ćwiczenie eksportu i przywracania oraz zestaw ewaluacyjny definiujący, co aplikacja ma osiągnąć. Wtedy „moglibyśmy przełączyć się” staje się miarą, którą ktoś może wykonać: czy zamiennik może kontynuować reprezentatywne przepływy pracy w ramach Twoich wymagań dotyczących jakości, uprawnień, opóźnień i kosztów? I zachowaj dane treningowe, do których masz prawo ponownego użycia, wraz z ich wersjami, konfiguracją strojenia i testami akceptacyjnymi. To umożliwia ponowne trenowanie, bez gwarancji identycznego zachowania, a identyfikator modelu dostrojonego wygasa w dniu określonym przez osobę, której nigdy nie spotkałeś.

Następnie używaj sesji hostowanych, pamięci podręcznej promptów i pobierania od dostawcy, gdziekolwiek pomagają. Często są doskonałe, a odmawianie ich z zasady jest kosztowne na swój sposób. Wymaganiem jest, aby rekordy, które przechowują, można było odzyskać i używać w innym miejscu, zachowując ich zasady dostępu i przechowywania. Wynajmuj moc obliczeniową; zachowaj kontrolę nad rekordem.

Nie przesadzałbym też z architekturą. Przed osiągnięciem dopasowania produktu do rynku, wypuszczenie wersji sześć tygodni wcześniej często przewyższa każdą warstwę abstrakcji, a startup, który buduje trzy zaplecza wyszukiwania zanim ma klientów, tworzy muzeum. Czy taka wymiana jest słuszna, zależy od produktu i kosztu ostatecznej przebudowy. Utrzymuj surowiec możliwy do odzyskania, a skrót pozostaje skrótem.

Część, która się zmieniła

Podczas gdy sztuczna inteligencja jedynie odpowiadała na pytania, utrata kontekstu była niewygodą. Przepisywałeś ponownie zapytanie i przechodziłeś dalej. Teraz rezerwuje spotkanie, zakłada zgłoszenie i ingeruje w CRM, a brak kontekstu prowadzi do zduplikowanej lub nieukończonej pracy w systemach należących do Twoich klientów.

Dostawcy modeli tworzą niezwykłe rozwiązania, z których korzystam codziennie. Odpowiedzialność, o której mówię, spoczywa na nas, którzy budujemy pośrednie platformy: udostępnianiu zależności i zachowywaniu wiarygodnego rekordu tego, co zostało zatwierdzone i co zostało zrealizowane.

Każdy zakończony przepływ pracy powinien pozostawić organizację z czymś, co może być ponownie wykorzystane — zweryfikowanym wynikiem, decyzją z możliwością śledzenia historii, jaśniejszym punktem wyjścia dla kolejnego zadania. Ta zgromadzona wartość powinna przetrwać model, który pomógł ją stworzyć.

Zadaj sobie pytanie, co nadal będziesz posiadał w środę rano.

Ilia Razvin jest założycielem i CEO IOSYA, platformy zwiększającej produktywność biznesową i automatyzującej przepływy pracy AI. Wcześniej opracował modele procesów typu grey-box oraz systemy wsparcia decyzji dla przemysłu chemicznego, a także posiada tytuł Master 2 w dziedzinie mikrosensorów i systemów wykrywania z Aix-Marseille Université.