Lideri de opinie

Memoria companiei tale ar trebui să reziste mai mult decât modelele AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Se întreabă adesea ce model alimentează compania mea. Răspunsul contează: stabilește calitatea, costul și limitele, și sunt dispus să petrec o oră pentru a-l discuta. De asemenea, vreau să știu un al doilea lucru: ce va mai avea organizația când acel model se va schimba.

Puneți-l ca o dată. Dacă furnizorul dumneavoastră și-ar dubla prețul într-o marţi, sau ar retrage endpoint-ul pe care l-ați construit, ce ați mai deține miercuri dimineață?

Pentru multe companii, răspunsul sincer este: o cheie API, o factură și un istoric de conversație foarte lung, stocat pe serverele altcuiva, sub programul de păstrare al altcuiva.

Formarea mea este în chimie. Am petrecut ani construind modele grey-box pentru instalații chimice, integrate în SCADA, rezultate de laborator și notițele operatorului. Această muncă învață rapid o regulă: un număr fără condițiile sale nu este un rezultat. Dacă cineva a înlocuit un senzor săptămâna trecută și nimeni nu a notat acest lucru, citirea de pe ecran nu explică nimic.

Aceasta este o problemă de jurnal de laborator. Acum apare ca o problemă de achiziții și rareori se regăsește în foaia în care se decide bugetul pentru AI.

Trei întrebări care primesc un singur răspuns

Un spațiu de context mai mare permite unui model să folosească mai multe informații într-o singură cerere. Stocarea durabilă determină ce supraviețuiește între cereri. Portabilitatea stabilește dacă acele informații rămân utilizabile când furnizorul se schimbă. Acestea sunt întrebări arhitecturale separate, iar fereastra de un milion de tokenuri i-a încurajat pe toți să le trateze ca pe una singură.

Documentația proprie a Google oferă analogia directă: „O analogie pentru fereastra de context este memoria pe termen scurt.” Luaţi asta literal. Memoria pe termen scurt este ceea ce pierdeţi.

Așadar, fiecare furnizor care vinde o fereastră enormă vinde și ceva separat pentru a păstra starea. Citiți aceste straturi cu atenție, în cuvintele lor, și notați ce acoperă fiecare în mod real.

OpenAI stochează obiectele Response implicit timp de 30 de zile; Obiectele de tip Conversation și elementele lor sunt exceptate de la acel TTL. Ștergerea în 30 de zile a Amazon se aplică the Bedrock Session Management API, și acoperă doar acel API. Unealta de memorie pe partea clientului a Anthropic ilustrează o limită utilă: modelul solicită operații de memorie, aplicația controlează stocarea, în timp ce aceeași companie livrează și stocări de memorie gestionate pentru agenții săi găzduiți.

Toate acestea sunt decizii obișnuite de inginerie, publicate deschis. Ele înseamnă, de asemenea, că regulile de păstrare pentru contextul de lucru al companiei dumneavoastră trăiesc în notele de lansare ale altcuiva, și ar trebui să puteți indica ce regulă se aplică fiecărei dintre datele dumneavoastră.

Unde se află de fapt costul de schimbare

Înlocuirea unui apel de generare de text cu altul se rezolvă în weekend. De aceea „suntem multi-model” este o afirmație atât de ușor de rostit. Straturile costisitoare sunt cele pe care nimeni nu le demonstrează.

Embedding-uri.Schimbarea încărcare modelul necesită de obicei reîncărcarea corpusului și migrarea sau reconstruirea indexului.generare model nu impune o astfel de cerință, iar cele două sunt confundate constant — de obicei de către cei care promit că migrarea va fi rapidă. Literatura din 2025 descrie calea standard ca “re-encodarea întregului corpus și reconstruirea indexului Approximate Nearest Neighbor (ANN), ducând la perturbări operaționale semnificative și costuri computaționale”; contribuția proprie a acelui articol, Drift-Adapter, este o metodă pentru amânarea reconstrucției prin învățarea unei transformări între spațiile de embedding. Oricum, costul migrației acoperă validarea recuperării și munca operațională, precum și apelurile de embedding în sine.

Comportament ajustat fin. O propoziție din Cohere’s septembrie 2025 deprecation notice aparține deasupra fiecărui birou de achiziții: “Modelele ajustate fin nu vor mai fi accesibile.” Comportamentul pe care l-ați plătit să îl creați, retras odată cu endpoint-ul care îl găzduia. Toată lumea a urmat procesul publicat. Modelul dumneavoastră a dispărut totuși.

Comportament al promptului și al uneltelor. Aceleași instrucțiuni produc o aplicație diferită pe un model diferit. Într-o aplicație enterprise, cercetătorii au raportat scăderea ratei de trecere a regresiei de la 100% pe modelul original la 97,3% pe unul mai nou cu prompturi identice, recuperată doar după o reproiectare deliberată a promptului. Scenariile de test apar în producție la propriile lor frecvențe, astfel încât acea cifră nu susține nicio estimare a frecvenței cu care fluxurile de lucru live eșuează. Regula operațională pe care o susține este mai simplă: validați fiecare actualizare a modelului la nivel de aplicație, personal, înainte să ajungă la un client.

Toate acestea ajung în factură în cele din urmă, mult după ce paginile de prețuri au fost comparate.

Altcineva deține calendarul tău

Deprecarea rulează pe un program publicat, iar programele nu sunt ale tale. OpenAI a dat un preaviz de un an înainte de a închide API-ul Assistants în august 2026 – generos conform standardelor aceleiași pagini, unde GPT-4.5 Preview a primit aproximativ trei luni. Mistral’s politică este de șase luni pentru modelele GA și de o lună pentru preview și cele de la terți, cu un avertisment că un alias rulant „poate expune la actualizări silențioase ale comportamentului modelului și ale prețurilor.”

AWS spune partea tăcută cu voce tare în politica de ciclu de viață: „Migrați la un model Activ înainte de data EOL; migrarea nu se va întâmpla automat.”

Foaia de parcurs are un co-autor. Nu participă niciodată la ședințele de planificare și nu îi pasă în ce trimestru vă aflați.

Prețul este, de asemenea, o parte în mișcare

La tarifele Standard listate de Gemini 3.7 Flash, cinci miliarde de tokenuri de intrare necache și o miliardă de tokenuri de ieșire facturate costă 7.500 $ pe lună. Tarifele programate în prezent pentru 1 ianuarie 2027 ar duce factura de tokenuri la 15.000 $, înainte de alte taxe sau reduceri, în timp ce produsul dumneavoastră face exact ceea ce făcea înainte.

O listă de prețuri înghețată poate genera, de asemenea, o factură mai mare. Anthropic’s documentație de prețuri notează că tokenizer‑ul utilizat de generațiile sale mai noi de modele „produce aproximativ 30 % mai mulți tokeni pentru același text” – depinde de conținut și este specific acelor generații – ceea ce face ca efectul asupra oricărei facturi să fie ceva ce trebuie să măsurați. Așadar, măsurați tokenii pentru care vi se facturează. O fișă de tarif, luată singură, nu vă va spune.

Pentru un produs care rulează fluxuri de lucru, măsura economică utilă este costul unei sarcini finalizate cu succes, incluzând reîncercările și revizia umană. Acest indicator se modifică când modelul se schimbă, chiar dacă fișa de tarif rămâne neschimbată.

Și nimic din acestea nu este negociabil dintr-o poziție în care plecarea durează un an. Capgemini a sondat 1.300 de directori executivi din organizații cu venituri de miliarde de dolari în primăvara 2026 despre furnizorii critici de tehnologie în general: 36 % au declarat că renunțarea la unul ar dura peste doisprezece luni, iar unul din zece nu avea deloc o alternativă viabilă. Aceasta este o descriere a unei relații de furnizor fără o sursă secundară.

Duceți-o la Achiziții

Conduc o companie franceză, înregistrată în Marsilia, găzduită în Europa, și voi continua să omit discursul despre suveranitate în abstract. Independența față de fiecare furnizor de tehnologie este inaccesibilă pentru o companie normală. Același studiu Capgemini a constatat că 59 % dintre directorii executivi consideră suveranitatea digitală completă nerealistă, și sunt de acord cu ei.

Înțelegerea și controlul dependențelor critice reprezintă o sarcină mai mică și una posibilă. Trei întrebări, toate răspunzătoare într-o ședință: unde sunt stocate și procesate datele noastre, cine poate accesa-le și ce ar fi necesar pentru a continua să funcționeze cu un alt furnizor?

Fiecare companie știe cum să pună această întrebare în legătură cu logistica, plățile și stocarea în cloud. Întrebată despre contextul de lucru, dependența europeană apare în ședință ca o discuție despre sursa secundară cu un număr atașat, care este o formă pe care achizițiile o pot acționa.

O avertizare privind cifrele citate aici. Faptul că o întreprindere folosește mai multe modele ne spune puțin despre capacitatea sa de a muta contextul de lucru între furnizori. Aceasta necesită un test separat: pot fi transferate în continuare înregistrările, permisiunile și munca neterminată și să fie utilizate?

Ce cu adevărat un model interschimbabil

O interfață partajată între modele este utilă și aș construi una. Ar trebui să facă vizibile capabilitățile și dependențele specifice fiecărui model. Portabilitatea nu presupune că toate modelele se comportă identic, iar o abstractizare care uniformizează diferențele elimină în tăcere motivul pentru care ați plătit pentru un model de calitate.

Munca mai grea constă în deținerea stării pe care niciun furnizor nu ar trebui să o fie singurul custode. Patru lucruri, în ordinea în care se defectează.

O înregistrare autoritară sub controlul dumneavoastră. Mesaje, surse recuperate, aprobări, puncte de control ale execuției. Înregistrați ce a fost finalizat în sistemele externe și ce poate fi reluat în siguranță: e‑mailul poate fi trimis în timp ce confirmarea nu a fost salvată, iar o procedură de recuperare care nu știe acest lucru îl va trimite de două ori. Orice stare a furnizorului pe care nu o puteți reconstrui este o dependență. Notați‑o ca una singură, explicit, înainte ca un incident să facă documentarea pentru dumneavoastră.

Sursa alături de fiecare vector. Un vector este un artefact compilat; fragmentul este codul sursă. Stocați documentul sursă și versiunea acestuia, ID‑ul documentului, limitele fragmentului, versiunea fragmentatorului, modelul de încorporare cu versiunea și dimensiunile, versiunea indexului și ce procesare a generat textul. Un fragment de text stocat singur nu va reconstrui un tabel, o imagine sau un rezultat OCR. Păstrarea tuturor acestor elemente transformă o reindexare într-o migrație planificată, ceea ce reprezintă confortul pe care l‑aș promite.

Înregistrări care disting sursa, inferența și decizia. Memoria trebuie să separe ceea ce a spus o sursă, ceea ce a inferat un model și ceea ce a aprobat o persoană. Un client care promite să plătească joi, o presupunere a modelului că plata va întârzia și o prelungire convenită până vineri sunt trei înregistrări diferite cu trei stări diferite, iar sistemul trebuie să știe pe care dintre ele poate acționa. Fiecare are nevoie de origine, domeniu de aplicare, reguli de acces și stare curentă, inclusiv dacă a fost corectată sau înlocuită. Un transcript poate conține dovezile; redarea acestuia nu identifică în mod fiabil care concluzii sunt încă actuale și care decizii mai sunt valabile.

Portabilitatea pe care ați testat-o efectiv. Faceți-o testabilă în două moduri: un exercițiu de export‑și‑restaurare și o suită de evaluare care definește ce trebuie să realizeze aplicația. Atunci „am putea schimba” devine o măsură pe care cineva o poate rula: poate înlocuirea să continue fluxurile de lucru reprezentative în cadrul cerințelor dumneavoastră privind calitatea, permisiunile, latența și costul? Și păstrați datele de antrenament pe care aveți dreptul să le reutilizați, împreună cu versiunile lor, configurația de ajustare și testele de acceptare. Acestea fac posibilă re‑antrenarea, fără garanție de comportament identic, iar ID‑ul modelului ajustat expiră la o dată stabilită de cineva pe care nu l‑ați întâlnit niciodată.

Apoi utilizați sesiuni găzduite, cache‑uri de prompt și recuperare de la furnizor ori de câte ori acestea ajută. Adesea sunt excelente, iar refuzarea lor din principiu este un fel de cost ridicat. Cerința este ca înregistrările pe care le dețin să poată fi recuperate și utilizate în altă parte, păstrând intacte regulile de acces și retenție. Închiriați calculul; păstrați controlul asupra înregistrării.

Nu aș exagera nici eu în promovarea arhitecturii. Înainte de potrivirea produs‑piață, livrarea cu șase săptămâni mai devreme depășește adesea orice strat de abstractizare, iar o startup care construiește trei backend‑uri de recuperare înainte să aibă clienți a construit un muzeu. Dacă această alegere este corectă depinde de produs și de costul reconstrucției ulterioare. Păstrați materia primă recuperabilă și o scurtătură rămâne o scurtătură.

Partea care s‑a schimbat

În timp ce IA răspundea doar la întrebări, pierderea contextului era o neplăcere. Reintroduceai promptul și mergeai mai departe. Acum programează întâlnirea, înregistrează tichetele și interacționează cu CRM‑ul, iar lipsa contextului duce la muncă duplicată sau neterminată în sistemele care aparțin clienților dumneavoastră.

Furnizorii de modele creează lucruri extraordinare și le folosesc zilnic. Responsabilitatea pe care o descriu revine celor dintre noi care construiesc platformele intermediare: să facem dependențele vizibile și să păstrăm o înregistrare fiabilă a ceea ce a fost autorizat și a ceea ce a fost finalizat.

Fiecare flux de lucru finalizat ar trebui să lase organizației ceva ce poate reutiliza — un rezultat verificat, o decizie cu un istoric trasabil, un punct de plecare mai clar pentru următoarea sarcină. Acea valoare acumulată ar trebui să depășească durata de viață a modelului care a contribuit la crearea ei.

Întrebați-vă ce ați mai deține miercuri dimineață.

Ilia Razvin este fondatorul și CEO-ul IOSYA, o platformă de productivitate în afaceri și automatizare a fluxurilor de lucru AI. Anterior, a dezvoltat modele de proces grey-box și sisteme de sprijin decizional pentru producția chimică și deține un Master 2 în microsenzori și sisteme de detectare de la Aix-Marseille Université.