AI-modeller och plattformar

Enfabrica Avslöjar Ethernet-baserad Minnesväv som Kan Omdefiniera AI-inferens i Stor Skala

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Enfabrica, ett Silicon Valley-baserat startup-backat av Nvidia (NVDA ), har avslöjat en banbrytande produkt som kan förändra hur storskaliga AI-arbetsbelastningar distribueras och skalar. Företagets nya Elastic Memory Fabric System (EMFASYS) är den första kommersiellt tillgängliga Ethernet-baserade minnesväven som är specifikt utformad för att hantera den centrala flaskhalsen för generativ AI-inferens: minnesåtkomst.

När AI-modellerna blir alltmer komplexa, kontextmedvetna och beständiga – och kräver stora mängder minne per användarsession – levererar EMFASYS en ny approach för att koppla loss minnet från beräkningen, vilket gör det möjligt för AI-datacenter att dramatiskt förbättra prestandan, sänka kostnaderna och öka utnyttjandet av deras mest dyra resurser: GPU:er.

Vad är en Minnesväv – och Varför Är Den Viktig?

Traditionellt har minnet inom datacenter varit tätt bundet till den server eller nod som det befinner sig i. Varje GPU eller CPU har endast tillgång till det höghastighetsminne som är direkt anslutet till den – vanligtvis HBM för GPU:er eller DRAM för CPU:er. Denna arkitektur fungerar bra när arbetsbelastningarna är små och förutsägbara. Men generativ AI har förändrat spelet. LLM:er kräver tillgång till stora kontextfönster, användarhistorik och multiagentminne – allt detta måste bearbetas snabbt och utan dröjsmål. Dessa minneskrav överstiger ofta den tillgängliga kapaciteten för lokalt minne, vilket skapar flaskhalsar som strandsätter GPU-kärnor och blåser upp infrastrukturkostnaderna.

En minnesväv löser detta genom att omvandla minnet till en delad, distribuerad resurs – en sorts nätverksansluten minnepool som är tillgänglig för varje GPU eller CPU i klustret. Tänk på det som att skapa en “minnemoln” inom datacenterhyllan. Istället för att replikera minne över servrar eller överbelasta dyrt HBM, tillåter en väv att minnet kan aggregeras, disaggregeras och nås på begäran via ett höghastighetsnätverk. Detta gör det möjligt för AI-inferensarbetsbelastningar att skala mer effektivt utan att vara begränsade av de fysiska minnesbegränsningarna för en enskild nod.

Enfabricas Tillvägagångssätt: Ethernet och CXL, Tillsammans för Första Gången

EMFASYS uppnår denna rack-skala minnesarkitektur genom att kombinera två kraftfulla teknologier: RDMA över Ethernet och Compute Express Link (CXL). Den förstnämnda möjliggör ultralåglatens, höghastighetsdataöverföring över standard-Ethernetnätverk. Den senare tillåter minnet att kopplas loss från CPU:er och GPU:er och poolas till delade resurser, tillgängliga via höghastighets-CXL-länkar.

I centrum för EMFASYS ligger Enfabricas ACF-S-chip, en 3,2 terabit-per-sekund (Tbps) “SuperNIC” som förenar nätverks- och minneskontroll i en enda enhet. Denna chip tillåter servrar att gränssnitt med massiva pooler av kommersiellt tillgängligt DDR5 DRAM – upp till 18 terabyte per nod – distribuerat över hyllan. Avgörande är att det gör detta med hjälp av standard-Ethernetportar, vilket gör det möjligt för operatörer att utnyttja sin befintliga datacenterinfrastruktur utan att investera i proprietära interconnects.

Det som gör EMFASYS särskilt övertygande är dess förmåga att dynamiskt avlasta minnesbundna arbetsbelastningar från dyra GPU-anslutna HBM till betydligt mer överkomliga DRAM, samtidigt som den upprätthåller mikrosekundnivååtkomstlatens. Programvarustacken bakom EMFASYS innehåller intelligent cachelagring och lastbalanseringsmekanismer som döljer latens och orkestrerar minnesrörelse på sätt som är transparenta för LLM:erna som körs på systemet.

Konsekvenser för AI-branschen

Detta är mer än bara en smart hårdvarulösning – det representerar en filosofisk förändring i hur AI-infrastruktur byggs och skalar. När generativ AI går från nyhet till nödvändighet, med miljarder användarfrågor som bearbetas dagligen, har kostnaden för att betjäna dessa modeller blivit ohållbar för många företag. GPU:er är ofta underutnyttjade inte på grund av brist på beräkning, utan för att de sitter sysslolösa och väntar på minne. EMFASYS hanterar denna obalans direkt.

Genom att möjliggöra poolad, väv-ansluten minne som är tillgänglig via Ethernet, erbjuder Enfabrica datacenteroperatörer en skalbar alternativ till att kontinuerligt köpa fler GPU:er eller HBM. Istället kan de öka minneskapaciteten modulärt, med hjälp av standard-DRAM och intelligent nätverk, vilket minskar den totala fotavtrycket och förbättrar ekonomin för AI-inferens.

Konsekvenserna går utöver omedelbara kostnadsbesparingar. Denna typ av disaggregerad arkitektur banar väg för minnes-tjänstmodeller, där kontext, historik och agenttillstånd kan bestå längre än en enda session eller server, vilket öppnar dörren för mer intelligenta och personanpassade AI-system. Det skapar också scenen för mer robusta AI-moln, där arbetsbelastningar kan distribueras elastiskt över en hylla eller hela datacenter utan rigid minnesbegränsning.

Att Se Framåt

Enfabricas EMFASYS provas för närvarande med utvalda kunder, och även om företaget inte har avslöjat vilka dessa samarbetspartner är, Reuters rapporterar att stora AI-molnleverantörer redan testar systemet. Detta positionerar Enfabrica inte bara som en komponentleverantör, utan som en nyckelaktör i nästa generation av AI-infrastruktur.

Genom att koppla loss minnet från beräkningen och göra det tillgängligt över höghastighets-, kommersiella Ethernetnätverk, lägger Enfabrica grunden för en ny era av AI-arkitektur – en där inferens kan skalas utan kompromiss, där resurser inte längre strandsätts och där ekonomin för att distribuera stora språkmodeller slutligen börjar göra sig gällande.

I en värld som alltmer definieras av kontextrika, multiagenta AI-system är minnet inte längre en biroll – det är scenen. Och Enfabrica satsar på att den som bygger den bästa scenen kommer att definiera AI-prestandan under många år framöver.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.