Modele și platforme AI
Enfabrica prezintă o memorie bazată pe Ethernet care ar putea redesena inferența IA la scară

Enfabrica, o companie startup din Silicon Valley, sprijinită de Nvidia (NVDA ), a prezentat un produs revoluționar care ar putea schimba radical modul în care sunt implementate și scalate sarcinile de lucru IA la scară largă. Noul sistem de memorie elastic al companiei, EMFASYS, este primul sistem de memorie bazat pe Ethernet, disponibil comercial, special conceput pentru a aborda blocajul central al inferenței IA generative: accesul la memorie.
Într-un moment în care modelele de IA devin tot mai complexe, conștiente de context și persistente, necesitând cantități uriașe de memorie pentru fiecare sesiune de utilizator, EMFASYS oferă o abordare inovatoare pentru decuplarea memoriei de calcul, permițând centrelor de date IA să îmbunătățească semnificativ performanța, să reducă costurile și să crească utilizarea resurselor lor cele mai scumpe: GPU-urile.
Ce este o memorie de tip fabrică și de ce este importantă?
În mod tradițional, memoria din centrele de date a fost strâns legată de serverul sau nodul în care se află. Fiecare GPU sau CPU are acces doar la memoria de înaltă viteză direct atașată la acesta – de obicei HBM pentru GPU-uri sau DRAM pentru CPU-uri. Această arhitectură funcționează bine atunci când sarcinile de lucru sunt mici și previzibile. Dar IA generativă a schimbat jocul. Modelele de limbaj necesită acces la ferestre de context mari, istoric de utilizator și memorie multi-agent – toate acestea trebuie procesate rapid și fără întârziere. Aceste cerințe de memorie adesea depășesc capacitatea disponibilă a memoriei locale, creând blocaje care blochează nucleele GPU și inflamează costurile infrastructurii.
O memorie de tip fabrică rezolvă acest lucru prin transformarea memoriei într-o resursă partajată și distribuită – o fel de piscină de memorie conectată la rețea, accesibilă de orice GPU sau CPU din cluster. Gândiți-vă la aceasta ca la crearea unui “nor de memorie” în interiorul raftului de centre de date. În loc de a replica memoria pe servere sau de a supraîncărca memoria HBM scumpă, o fabrică de memorie permite memoriei să fie agregată, dezagregată și accesată la cerere prin intermediul unei rețele de înaltă viteză. Acest lucru permite sarcinilor de lucru de inferență IA să scaleze mai eficient, fără a fi încătușate de limitele fizice de memorie ale unui singur nod.
Abordarea Enfabrica: Ethernet și CXL, împreună în sfârșit
EMFASYS realizează această arhitectură de memorie la scară de raft prin combinarea a două tehnologii puternice: RDMA pe Ethernet și Compute Express Link (CXL). Primul permite transferul de date cu latență ultra-scăzută și debit ridicat pe rețelele Ethernet standard. Al doilea permite memoriei să fie detașată de CPU-uri și GPU-uri și să fie grupată în resurse partajate, accesibile prin intermediul legăturilor CXL de înaltă viteză.
La nucleul EMFASYS se află cipul ACF-S al Enfabrica, un “SuperNIC” de 3,2 terabiți pe secundă (Tbps) care combină networking-ul și controlul memoriei într-un singur dispozitiv. Acest cip permite serverelor să se conecteze la piscine masive de memorie DRAM de tip commodity – până la 18 terabiți pe nod – distribuite pe întregul raft. În mod crucial, acest lucru se realizează utilizând porturi Ethernet standard, permițând operatorilor să valorifice infrastructura existentă a centrelor de date fără a investi în interconectări proprietare.
Ce face EMFASYS deosebit de atractiv este capacitatea sa de a descărca dinamic sarcinile de lucru legate de memorie de la memoria scumpă HBM atașată la GPU-uri la memoria DRAM mult mai accesibilă, menținând în același timp o latență de acces la nivel de microsecunde. Stiva de software din spatele EMFASYS include mecanisme de caching inteligente și de echilibrare a încărcăturii care ascund latența și orchestrează mișcarea memoriei în moduri care sunt transparente pentru modelele de limbaj care rulează pe sistem.
Implicații pentru industria IA
Acesta este mai mult decât o simplă soluție hardware ingenioasă – reprezintă o schimbare filosofică în modul în care se construiesc și se scală infrastructurile de IA. Pe măsură ce IA generativă trece de la o noutate la o necesitate, cu miliarde de întrebări ale utilizatorilor procesate zilnic, costul de a furniza aceste modele a devenit insuportabil pentru multe companii. GPU-urile sunt adesea subutilizate nu din cauza lipsei de calcul, ci pentru că stau inactivă așteptând memoria. EMFASYS abordează direct acest dezechilibru.
Prin activarea memoriei agregate, atașate la fabrică și accesibile prin Ethernet, Enfabrica oferă operatorilor de centre de date o alternativă scalabilă la cumpărarea continuă de GPU-uri sau HBM. În schimb, aceștia pot crește capacitatea de memorie în mod modular, utilizând memoria DRAM de tip commodity și networking-ul inteligent, reducând astfel amprenta generală și îmbunătățind economia inferenței IA.
Implicațiile merg dincolo de economiile imediate. Această arhitectură dezagregată deschide calea către modele de memorie ca serviciu, în care contextul, istoricul și starea agentului pot persista dincolo de o singură sesiune sau server, deschizând ușa către sisteme de IA mai inteligente și personalizate. De asemenea, aceasta stabilește scena pentru nori de IA mai rezistenți, în care sarcinile de lucru pot fi distribuite elastic pe întregul raft sau centru de date, fără limitări rigide de memorie.
Privind înainte
Sistemul EMFASYS al Enfabrica este în prezent disponibil pentru clienții selectați, iar deși compania nu a dezvăluit cine sunt acești parteneri, Reuters raportează că principalii furnizori de nor de IA sunt deja testând sistemul. Acest lucru poziționează Enfabrica nu doar ca furnizor de componente, ci și ca un factor cheie în următoarea generație de infrastructură de IA.
Prin decuplarea memoriei de calcul și prin faptul că o face disponibilă pe rețele de înaltă viteză, de tip commodity, Ethernet, Enfabrica pregătește terenul pentru o nouă eră de arhitectură de IA – una în care inferența poate scala fără compromis, în care resursele nu mai sunt blocate și în care economia de implementare a modelelor de limbaj mare începe în sfârșit să aibă sens.
Într-o lume din ce în ce mai definită de sisteme de IA bogate în context și multi-agente, memoria nu mai este un actor secundar – este scena. Și Enfabrica pariază că cel care construiește cea mai bună scenă va defini performanța IA pentru următorii ani.












