Modele și platforme AI
Peretele GPU se sparge: Revoluția nevăzută în arhitecturile post-Transformer

Pentru ultimii cinci ani, industria inteligenței artificiale a fost, în esență, sinonimă cu un singur cuvânt: Transformer. De la lansarea articolului seminal “Atenția este tot ce aveți nevoie” în 2017, această arhitectură a dominat domeniul. De la GPT la Claude, practic toate modelele care au făcut titluri se bazează pe același mecanism subiacent de auto-atenție. Am presupus, în general, că calea către o inteligență artificială mai bună este pur și simplu o chestiune de scară. În practică, acest lucru înseamnă antrenarea unor Transformatori mai mari, cu mai multe date, pe clusteruri mai mari de GPU.
Deși această credință a condus la multe descoperiri, acum ajunge la limitele sale. Lovim un “Perete GPU”, o barieră nu numai de putere de calcul brut, ci și de lățime de bandă a memoriei și de durabilitate economică. În timp ce lumea se concentrează pe cursa pentru modele cu trilioane de parametri, are loc o schimbare radicală în laboratoarele de cercetare. O nouă valură de “arhitecturi post-Transformer” este în curs de apariție pentru a sparge limitele paradigmei actuale. Această schimbare promite să facă inteligența artificială mai eficientă, mai accesibilă și capabilă să raționeze peste contexte infinite.
Peretele de siliciu: De ce Transformatorii ajung la un zid
Pentru a înțelege de ce avem nevoie de o schimbare, trebuie să înțelegem mai întâi încuietoarea regimului actual. Transformatorii sunt incredibil de puternici, dar sunt și remarcabil de ineficienți în anumite moduri. Nucleul capacității lor se află în “mecanismul de atenție”, care permite modelului să se uite la fiecare token dintr-o secvență și să calculeze relația sa cu fiecare alt token. Acesta este ceea ce le dă capacitatea de a înțelege contextul în mod remarcabil.
Însă, această capacitate vine cu o eroare fatală de crescere quadratică. Dacă dublați lungimea documentului pe care doriți ca inteligența artificială să îl citească, munca de calcul necesară nu se dublează doar, ci se cvadruplează. Pe măsură ce ne străduim pentru modele “cu context infinit” care pot citi întregi biblioteci sau coduri, cerințele de calcul devin extrem de ridicate.
Însă, problema mai imediată este memoria, în special “KV Cache” (Cache de cheie-valoare). Pentru a genera text fluent, un Transformer trebuie să păstreze o istorie în curs de desfășurare a tot ceea ce a spus recent în memoria de înaltă viteză a GPU (VRAM). Pe măsură ce conversația se prelungește, această cache se umflă, consumând cantități masive de memorie doar pentru a-și aminti ce s-a întâmplat cu trei paragrafe în urmă.
Acest lucru creează “Peretele GPU”. Nu numai că ne lipsește de cipuri, ci și de lățimea de bandă a memoriei pentru a le alimenta. Am construit motoare care devin tot mai mari, dar devin imposibil de alimentat. Mult timp, soluția industriei a fost pur și simplu să cumpere mai multe NVIDIA H100 (NVDA ). Însă, această forță brută ajunge la un punct de rentabilitate descrescătoare. Nu avem nevoie de un motor care consumă combustibil în mod quadratic, ci de o nouă arhitectură.
Revoluția nevăzută
În timp ce cercetarea mainstream s-a concentrat pe LLM, un grup de cercetători a reexaminat o idee veche: Rețelele neuronale recurente (RNN). Înainte de Transformatori, RNN-urile erau standardul pentru limbaj. Ele procesau textul secvențial, cuvânt cu cuvânt, actualizând un “stat” intern ascuns pe măsură ce înaintau. Ele erau incredibil de eficiente pentru că nu aveau nevoie să se uite înapoi la întreaga istorie, ci doar să păstreze “esența” ei în memoria lor.
RNN-urile au eșuat pentru că nu puteau gestiona dependențe lungi; “uitau” începutul unei propoziții până la sfârșitul ei. Ele erau, de asemenea, lente în antrenare pentru că nu puteau fi paralelizate. Acest lucru înseamnă că trebuiau să proceseze cuvântul A înainte de a putea procesa cuvântul B. Transformatorii au rezolvat acest lucru prin procesarea tuturor datelor deodată (paralelizare) și păstrarea tuturor informațiilor în memorie (atenție).
Același lucru se întâmplă și cu apariția unei noi valuri de arhitecturi care combină cele mai bune dintre ambele lumi. Acestea sunt cunoscute în general sub numele de Modele spațiu-stare (SSM). Ele oferă viteza de antrenare a Transformatorilor (paralelizabilă), dar și eficiența de inferență a RNN-urilor (scalare liniară).
Una dintre arhitecturile proeminente din această nouă valură este Mamba. Lansat la sfârșitul anului 2023 și rafinat pe tot parcursul anului 2024, Mamba este o schimbare fundamentală în modul în care modelele gestionează informațiile. În contrast cu un Transformer, care păstrează o copie originală a fiecărui cuvânt pe care l-a văzut vreodată în bufferul său de memorie, Mamba folosește un “spațiu-stare selectiv”.
Putem înțelege diferența dintre Transformer și Mamba prin imaginația unui savant care ține deschisă fiecare carte pe care a citit-o vreodată pe o masă uriașă, scannând mereu înapoi și înainte pentru a găsi legături. Mamba, pe de altă parte, este un savant care citește cartea o dată și comprimă insight-urile cheie într-un caiet foarte eficient. Când Mamba generează următorul cuvânt, nu trebuie să se uite înapoi la textul brut; se uită la starea sa comprimată.
Această distincție schimbă economia implementării inteligenței artificiale. Cu Mamba și arhitecturi similare, cum ar fi RWKV (Receptanță ponderată cheie-valoare), costul generării textului nu explodează pe măsură ce secvența se lungeste. Teoretic, puteți hrăni aceste modele cu un milion de cuvinte de context, iar costul calculului pentru a genera următorul token rămâne același ca și cum ați fi hrănit doar zece cuvinte.
Revenirea recurenței
Prin spatele revoluției, o grupare de cercetători a reexaminat o idee veche: Rețelele neuronale recurente (RNN). Înainte de Transformatori, RNN-urile erau standardul pentru limbaj. Ele procesau textul secvențial, cuvânt cu cuvânt, actualizând un “stat” intern ascuns pe măsură ce înaintau. Ele erau incredibil de eficiente pentru că nu aveau nevoie să se uite înapoi la întreaga istorie, ci doar să păstreze “esența” ei în memoria lor.
RNN-urile au eșuat pentru că nu puteau gestiona dependențe lungi; “uitau” începutul unei propoziții până la sfârșitul ei. Ele erau, de asemenea, lente în antrenare pentru că nu puteau fi paralelizate. Acest lucru înseamnă că trebuiau să proceseze cuvântul A înainte de a putea procesa cuvântul B. Transformatorii au rezolvat acest lucru prin procesarea tuturor datelor deodată (paralelizare) și păstrarea tuturor informațiilor în memorie (atenție).
Acum, asistăm la apariția unei noi valuri de arhitecturi care combină cele mai bune dintre ambele lumi. Acestea sunt cunoscute în general sub numele de Modele spațiu-stare (SSM). Ele oferă viteza de antrenare a Transformatorilor (paralelizabilă), dar și eficiența de inferență a RNN-urilor (scalare liniară).
Una dintre arhitecturile proeminente din această nouă valură este Mamba. Lansat la sfârșitul anului 2023 și rafinat pe tot parcursul anului 2024, Mamba este o schimbare fundamentală în modul în care modelele gestionează informațiile. În contrast cu un Transformer, care păstrează o copie originală a fiecărui cuvânt pe care l-a văzut vreodată în bufferul său de memorie, Mamba folosește un “spațiu-stare selectiv”.
Putem înțelege diferența dintre Transformer și Mamba prin imaginația unui savant care ține deschisă fiecare carte pe care a citit-o vreodată pe o masă uriașă, scannând mereu înapoi și înainte pentru a găsi legături. Mamba, pe de altă parte, este un savant care citește cartea o dată și comprimă insight-urile cheie într-un caiet foarte eficient. Când Mamba generează următorul cuvânt, nu trebuie să se uite înapoi la textul brut; se uită la starea sa comprimată.
Această distincție schimbă economia implementării inteligenței artificiale. Cu Mamba și arhitecturi similare, cum ar fi RWKV (Receptanță ponderată cheie-valoare), costul generării textului nu explodează pe măsură ce secvența se lungeste. Teoretic, puteți hrăni aceste modele cu un milion de cuvinte de context, iar costul calculului pentru a genera următorul token rămâne același ca și cum ați fi hrănit doar zece cuvinte.
Ascensiunea hibridelor
Revoluția, însă, nu poate fi o înlocuire completă a Transformatorului, ci mai degrabă o evoluție către forme hibride. Asistăm deja la apariția unor modele precum Jamba (de la AI21 Labs), care combină straturi de Transformer cu straturi de Mamba.
Acest abordare hibridă oferă o soluție practică pentru a aborda limitările Transformatorului. Transformatorii rămân excepțional de puternici la anumite sarcini, în special pentru copierea detaliilor precise din context. Prin combinarea straturilor de Mamba (care gestionează procesarea majorității datelor și memoria pe termen lung) cu câteva straturi de atenție ale Transformatorului (care gestionează raționamentul ascuțit și imediat), obținem un model care combină cele mai bune dintre ambele lumi.
Un model hibrid creează o fereastră de context masivă care este, de fapt, utilizabilă. În prezent, mulți “context lung” Transformatori pretind că pot gestiona 100.000 de tokeni, dar performanța lor se degradează rapid pe măsură ce contextul se umple. Acest fenomen este cunoscut sub numele de “pierdut în mijloc“. Arhitectura hibridă menține coerența mult mai bine pe distanțe lungi, deoarece straturile SSM sunt proiectate special pentru a comprima și a transporta starea în timp.
Aceste evoluții schimbă focalizarea industriei de la “Calcul de antrenare” (cât de mare trebuie să fie clusterul pentru a construi modelul?) la “Economia inferenței” (cât de ieftin poate fi servit acest model pentru un miliard de utilizatori?). Dacă un model hibrid poate servi un utilizator cu 10% din costul unui Transformer, cazul de afaceri pentru aplicațiile de inteligență artificială se schimbă peste noapte.
Viitorul implementării inteligenței artificiale
Implicațiile acestei revoluții post-Transformer nu sunt limitate doar la centru de date. Peretele GPU a servit istoric ca un paznic, asigurând că doar cele mai mari giganti tehnologice, cu miliarde de dolari în hardware, pot construi și rula modele de ultimă generație. Arhitecturi eficiente, cum ar fi Mamba și RWKV, democratizează această putere. Dacă puteți rula un model de nivel GPT-4 pe o cartelă de consumator deoarece nu mai aveți nevoie de terabytes de VRAM pentru cache-ul cheie-valoare, controlul centralizat al inteligenței artificiale începe să se relaxeze. Putem vedea o renaștere a agenților de inteligență artificială locali, privați, care trăiesc în întregime pe computerul dvs., procesând datele dvs. private fără a trimite vreodată un pachet către cloud.
În plus, această eficiență este cheia pentru a debloca sistemele “Agentic AI“, care rulează în fundal timp de ore sau zile pentru a finaliza sarcini complexe. Transformatorii actuali sunt prea scumpi și lenti pentru a rula în bucle continue timp de perioade lungi. O arhitectură eficientă și liniară poate “gândi” și procesa bucle continuu fără a falimenta utilizatorul sau a supraîncălzi hardware-ul.
Concluzia
Transformerul a dominat titlurile de știri de inteligență artificială, dar în spatele scenei, o revoluție tăcută este în desfășurare. Peretele GPU ne împinge să reevaluăm modul în care modelele gestionează memoria și calculul. Arhitecturile post-Transformer, cum ar fi Mamba și modelele hibride, demonstrează că eficiența, și nu doar scara, va defini următoarea eră. Aceste inovații fac ferestrele de context masive practice, inferența mai ieftină și inteligența artificială avansată accesibilă dincolo de centrele de date. Viitorul inteligenței artificiale nu se află în modele mai mari, ci în modele mai inteligente care își amintesc, raționează și scalează eficient.












