Modele i platformy AI
Enfabrica prezentuje pamięć opartą na Ethernet, która może zmienić sposób rozumienia sztucznej inteligencji w skali

Enfabrica, startup z Doliny Krzemowej wspierany przez Nvidia (NVDA ), zaprezentował przełomowy produkt, który może znacząco zmienić sposób wdrażania i skalowania dużych obciążeń sztucznej inteligencji. Nowy system Elastic Memory Fabric System (EMFASYS) jest pierwszym komercyjnym rozwiązaniem opartym na Ethernet, specjalnie zaprojektowanym do rozwiązania podstawowego problemu inferencji sztucznej inteligencji: dostępu do pamięci.
W czasach, gdy modele sztucznej inteligencji stają się coraz bardziej złożone, świadome kontekstu i trwałe – wymagają ogromnych ilości pamięci na sesję użytkownika – EMFASYS dostarcza nowe podejście do odłączenia pamięci od obliczeń, umożliwiając centrům danych znaczącą poprawę wydajności, obniżenie kosztów i zwiększenie wykorzystania najdroższych zasobów: GPU.
Czym jest pamięć tkaninowa – i dlaczego jest ważna?
Tradycyjnie, pamięć w centrach danych była ściśle związana z serwerem lub węzłem, w którym się znajdowała. Każdy GPU lub CPU miał dostęp tylko do pamięci o wysokiej przepustowości, bezpośrednio do niego podłączonej – zwykle HBM dla GPU lub DRAM dla CPU. Ta architektura działa dobrze, gdy obciążenia są małe i przewidywalne. Ale sztuczna inteligencja zmieniła grę. LLM wymagają dostępu do dużych kontekstowych okien, historii użytkownika i pamięci wielu agentów – wszystko to musi być przetwarzane szybko i bez opóźnień. Te wymagania pamięciowe często przekraczają dostępną pojemność pamięci lokalnej, tworząc wąskie gardła, które powodują, że rdzenie GPU są bezczynne, a koszty infrastruktury rosną.
Pamięć tkaninowa rozwiązuje ten problem, przekształcając pamięć w udostępniony, rozproszony zasób – rodzaj sieciowej pamięci dostępnej dla każdego GPU lub CPU w klastrze. Wyobraź sobie to jako tworzenie “chmury pamięci” wewnątrz szafy centrum danych. Zamiast replikować pamięć na serwerach lub przeciążać drogą pamięć HBM, tkanina pozwala na agregację, dezagregację i dostęp do pamięci na żądanie przez sieć o wysokiej przepustowości. To umożliwia obciążeniom inferencji sztucznej inteligencji skalowanie się bardziej efektywnie, bez ograniczeń wynikających z fizycznych ograniczeń pamięci jednego węzła.
Podejście Enfabrica: Ethernet i CXL, razem nareszcie
EMFASYS osiąga tę architekturę pamięci na poziomie szafy, łącząc dwie potężne technologie: RDMA nad Ethernetem i Compute Express Link (CXL). Pierwsza umożliwia ultra-niską latencję i wysoką przepustowość transferu danych przez standardowe sieci Ethernet. Druga pozwala na odłączenie pamięci od CPU i GPU i utworzenie wspólnych zasobów, dostępnych przez szybkie połączenia CXL.
W centrum EMFASYS znajduje się chip ACF-S Enfabrica, “SuperNIC” o przepustowości 3,2 terabitów na sekundę (Tbps), który łączy sieć i kontrolę pamięci w jednym urządzeniu. Ten chip pozwala serwerom na interfejs z ogromnymi pulami taniej pamięci DRAM – do 18 terabajtów na węzeł – rozproszonych w szafie. Co najważniejsze, robi to za pomocą standardowych portów Ethernet, umożliwiając operatorom wykorzystanie istniejącej infrastruktury centrum danych bez inwestowania w specjalistyczne łącza.
To, co sprawia, że EMFASYS jest szczególnie interesujący, to jego zdolność do dynamicznego przenoszenia obciążeń związanych z pamięcią z drogiej pamięci HBM do znacznie tańszej pamięci DRAM, przy jednoczesnym utrzymaniu opóźnienia na poziomie mikrosekund. Stos odpowiedni do EMFASYS obejmuje inteligentne mechanizmy buforowania i równoważenia obciążeń, które ukrywają opóźnienia i organizują ruch pamięci w sposób przezroczysty dla LLM uruchamianych w systemie.
Wnioski dla branży sztucznej inteligencji
To jest więcej niż tylko inteligentne rozwiązanie sprzętowe – reprezentuje filozoficzną zmianę w budowaniu i skalowaniu infrastruktury sztucznej inteligencji. Gdy sztuczna inteligencja przechodzi od nowinki do konieczności, z miliardami zapytań użytkowników przetwarzanych codziennie, koszt obsługi tych modeli stał się niewykonalny dla wielu firm. GPU są często niewykorzystane nie z powodu braku obliczeń, ale dlatego, że czekają na pamięć. EMFASYS rozwiązuje ten problem bezpośrednio.
Umożliwiając udostępnioną, tkaninową pamięć dostępną przez Ethernet, Enfabrica oferuje operatorom centrów danych skalowalną alternatywę dla ciągłego kupowania coraz większej liczby GPU lub pamięci HBM. Zamiast tego mogą oni zwiększać pojemność pamięci w sposób modułowy, wykorzystując tanie pamięci DRAM i inteligentne sieci, redukując całkowitą powierzchnię i poprawiając ekonomię inferencji sztucznej inteligencji.
Wnioski wykraczają poza natychmiastowe oszczędności kosztów. Tego rodzaju architektura dezagregowanej pamięci otwiera drogę do modeli pamięci jako usługi, w których kontekst, historia i stan agenta mogą przetrwać poza jedną sesją lub serwerem, otwierając drzwi do bardziej inteligentnych i personalizowanych systemów sztucznej inteligencji. Ustawia również scenę dla bardziej wytrzymałych chmur sztucznej inteligencji, w których obciążenia mogą być rozłożone elastycznie w szafie lub w całym centrum danych, bez sztywnych ograniczeń pamięci.
Wydanie
Enfabrica EMFASYS jest obecnie testowany z wybranymi klientami, a chociaż firma nie ujawniła, kim są ci partnerzy, Reuters donosi, że główni dostawcy chmury sztucznej inteligencji już testują ten system. To pozycjonuje Enfabrica nie tylko jako dostawcę komponentów, ale jako kluczowego dostawcę w następnej generacji infrastruktury sztucznej inteligencji.
Odłączając pamięć od obliczeń i udostępniając ją przez szybkie, tanie sieci Ethernet, Enfabrica tworzy podwaliny dla nowej ery architektury sztucznej inteligencji – jednej, w której inferencja może skalować się bez kompromisów, w której zasoby nie są już bezużyteczne, i w której ekonomia wdrażania dużych modeli językowych w końcu zaczyna mieć sens.
W świecie, który jest coraz bardziej definiowany przez systemy sztucznej inteligencji bogate w kontekst i wielu agentów, pamięć nie jest już tylko aktorem wspierającym – jest sceną. I Enfabrica stawia, że ten, kto zbuduje najlepszą scenę, zdefiniuje wydajność sztucznej inteligencji na lata do przodu.












