Lideri de opinie

Problema de memorie a inteligenței artificiale: De ce eficiența contextului lung schimbă totul și ce este necesar pentru a o face corect

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Un coleg care uită fiecare conversație anterioară în momentul în care se încheie nu ar dura mult în majoritatea joburilor. Însă multe afaceri cu inteligență artificială funcționează exact în acest fel. Sesiunea se închide și contextul dispare odată cu aceasta. Un consumator care lansează întrebări ocazionale poate să nu observe aproape deloc, dar o companie care rulează un proces care durează mai mult decât o singură ședință lovește limita aproape imediat.

Lucrul real continuă de la o sesiune la alta, iar o decizie luată joi se bazează de obicei pe una luată luni, cu gândirea din spatele ei necesitând să supraviețuiască între timp. O inteligență artificială care șterge totul atunci când o sesiune se încheie poate funcționa bine în interiorul sesiunii și totuși nu contribuie cu nimic la o sarcină care rulează pe o perioadă de o săptămână.

Inteligența artificială pentru întreprinderi a schimbat în mod tacit ceea ce cere de la un model. De-a lungul anilor, modelele au fost judecate în mare măsură după cât de multă cunoaștere au absorbit. Întreprinderile au nevoie acum de ele pentru a păstra informațiile corecte în vedere pe măsură ce se desfășoară lucrul, o capacitate care necesită un alt tip de inginerie eficientă. Până în prezent, capacitatea de a păstra acest nivel de cunoaștere persistentă nu a fost realizată din cauza cantității mari de memorie (GPU), calcul și cost necesare pentru a scala o astfel de capacitate. Menținerea unei latențe acceptabile și a nivelului de halucinație a modelului devine o provocare cu utilizarea concurentă atunci când se utilizează un context lung. Există o cerere tot mai mare pentru astfel de capacități de cunoaștere și nu există suficientă memorie și calcul pentru a le acoperi. Așadar, aceasta ridică întrebarea: cum puteți obține o inteligență mai precisă la scară, cu mai puțină infrastructură și amprentă?

Biroul și dulapul cu fișe

Două lucruri sunt incluse sub titlul de memorie și se comportă suficient de diferit, astfel încât restul depinde de menținerea lor separate.

Începeți cu fereastra de context, care reprezintă cât de mult poate lua un model și poate raționa într-o singură trecere. Funcționează ca suprafața unui birou. Unul mic ia câteva pagini odată, astfel încât tot restul așteaptă într-un dulap și este adus și șters pe măsură ce mergeți, în timp ce unul mare permite ca întregul dosar să fie deschis odată pe măsură ce lucrați peste el. Ceea ce ține biroul este măturat la sfârșitul zilei, în fiecare zi.

Memoria persistentă este dulapul cu fișe lângă birou. Sistemul alege ce să stocheze și îl readuce atunci când devine relevant, astfel încât ceva care s-a întâmplat săptămâna aceasta poate informa ceea ce face în săptămâna următoare. Acest depozit se extinde pe sesiuni și are nevoie de propriile sale decizii despre ce să salveze, cum să-l organizeze și când să-l readucă.

Mare parte din cursa de inginerie vizibilă a mers către birou. Ferestrele care au ținut câteva mii de simboluri acum rulează până la sute de mii, iar cele mai mari modele de la OpenAI și Anthropic ajung la aproximativ un milion.

Termenul pentru această muncă, „ingineria contextului”, a venit de la Tobi Lutke de la Shopify (SHOP ) și a fost popularizat de Andrej Karpathy în mijlocul anului 2025. Abilitatea de bază în orice aplicație serioasă de inteligență artificială, a scris Karpathy, este umplerea ferestrei cu informațiile corecte pentru următorul pas. Analogia sa a fost hardware – modelul ca procesor, fereastra ca memoria sa de lucru. Practicienii au adoptat rapid termenul, deoarece au fost în jurul ideii fără un etichetă pentru ea.

Avea un birou mai mare nu rezolvă problema memoriei

Aici este unde mișcarea evidentă – pur și simplu continuați să măriți biroul – se confruntă cu probleme.

Cercetătorii de la Stanford au arătat în 2024 că atunci când informațiile de care are nevoie un model se află în mijlocul unei intrări lungi, precizia lui scade brusc față de același fapt plasat la început sau la sfârșit. Au numit-o „pierdută în mijloc”, și a fost valabilă chiar și pentru modele create special pentru context lung. Punând mai multe în fața unui model, se dovedește că nu este același lucru cu faptul că modelul face uz reliable de informații.

Efectul a fost susținut pe măsură ce alte echipe au căutat să-l găsească, și un studiu din 2025 care rulează 18 modele de frontieră împotriva unor intrări din ce în ce mai lungi a găsit performanța se degradează mult înainte ca fereastra să fie chiar plină, un model pe care autorii l-au numit „putrezirea contextului”. Mărirea biroului și obținerea unui model care să raționeze curat peste tot pe el sunt două probleme separate, și prima nu face nimic pentru a rezolva a doua.

Curarea aduce mai mult decât capacitatea

Ingineria contextului a crescut într-o disciplină pe baza acestei afirmații, cu un studiu din 2025 care se bazează pe mai mult de 1.400 de lucrări care prezintă metodele sale și Gartner sfătuind clienții în iulie 2025 să prioritizeze contextul înainte de a face promisiuni. Meșteșugul a trecut de la a formula o instrucțiune mai ascuțită la a asambla un set mai ascuțit de intrări pentru modelul de a lucra.

O masă mai mare ridică pariul pe ceea ce alegeți să puneți pe ea. Împingeți un întreg depozit de documente pe suprafață și câteva pagini care contează se pierd printre zgomot, contradicții și versiuni înlocuite, în timp ce o selecție mai strânsă a ceea ce afectează cu adevărat sarcina permite aceluiași model să funcționeze semnificativ mai bine. Judecata stă în ceea ce aparține în fața modelului, cum este înfățișat, când apare și ce rămâne în dulap.

Acesta este pentru ce a fost creat RAG (retrieval-Augmented Generation): tăierea documentelor în fragmente și recuperarea celor care par relevante, pentru a evita o fereastră prea mică pentru a ține întregul. Să zicem că o dispută contractuală se bazează pe o clauză de pe pagina 200. Abordarea obișnuită taie contractul în fragmente și lasă un sistem de recuperare să aducă fragmentele care par relevante. Clasificați pagina 200 ca irelevantă și modelul nu vede clauza.

O fereastră dimensionată pentru întregul contract sări peste pașii de recuperare și oferă modelului clauza împreună cu tot ceea ce o înconjoară. Indiferent dacă modelul citește apoi o intrare lungă, aceasta este problema de fiabilitate din secțiunea anterioară, și este o problemă mai bună cu care să fi lăsat decât un sistem de recuperare care decide în mod liniștit că clauza nu merită să fie transmisă.

În interiorul unei sesiuni și după aceea

Contextul lung este ceea ce permite unui agent de inteligență artificială să lucreze pe o sarcină lungă, mai degrabă decât pe o singură schimbare. Un agent care gestionează o revizuire a conformității pe termen lung sau un furnizor care se înscrie păstrează întreaga sarcină în fereastră pe măsură ce rulează, astfel încât fiecare pas se bazează pe starea completă a sarcinii. O fereastră suficient de lungă poate substitui memoria în cadrul unei sesiuni.

Acolo este și unde se oprește asemănarea. Orice sistemul ar trebui să rețină săptămâna viitoare, odată ce această sesiune s-a închis, trebuie să trăiască undeva unde fereastra nu este.

Construirea unei astfel de memorii aduce o serie de probleme diferite, multe dintre care industria abia a început să le confrunte. Formarea mea în psihologie și neuroștiințe face ca comparația cu memoria umană să fie dificil de evitat. Nu recuperăm o înregistrare perfectă a unui eveniment. De fiecare dată când ne amintim, o reconstruim, și mici erori pot deveni gradual parte a versiunii acceptate. O memorie a mașinii poate dezvolta o problemă similară atunci când informațiile stocate sunt rezumate, combinate sau rescrise de mai multe ori. Pe măsură ce trece timpul, înregistrarea poate deveni mai departe de evenimentul original, cu excepția cazului în care cineva o verifică, corectează greșelile și înlătură informațiile care au devenit nerelevante.

Multe companii care implementează aceste sisteme nu au lovit încă aceste probleme, și puține sunt aproape de a le rezolva. Ceea ce aș urmări la un furnizor nu este mărimea ferestrei pe care o promovează. Un model care ține 10 milioane de simboluri este de mică valoare dacă majoritatea informațiilor pe care le păstrează sunt învechite, irelevante sau greșite. Răspunsurile sale pot arăta bine documentate, în timp ce se bazează pe materiale pe care afacerea nu ar fi trebuit să le încredințeze. Ceea ce aduce bani este judecata despre ce să păstreze și capacitatea de a raționa cu exactitate peste toate informațiile, pe o fracțiune din costul infrastructurii și amprenta. Acesta este modul de a face mai mult cu mai puțin, și nu toate ferestrele mai mari vin cu această capacitate reală.

Mathew Haswell este co-fondator al Refiant, o companie de inteligență artificială axată pe inteligență artificială eficientă, compresie și crearea de modele mai eficiente și practice pentru implementare, inclusiv context lung. Master în științe medicale și neuroștiințe prin pregătire, el a ocupat roluri executive strategice, de afaceri, operațiuni și produse în domeniul tehnologiei, fintech, jocurilor, retailului și serviciilor financiare.