Modely a platformy AI

Enfabrica odhaluje Ethernetový paměťový materiál, který může předefinovat AI inference v měřítku

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Enfabrica, startup z údolí Silicon Valley, který je podporován společností Nvidia (NVDA ), představil průlomový produkt, který může výrazně změnit způsob, jakým jsou nasazovány a škálovány velké AI úkoly. Nový systém Elastic Memory Fabric System (EMFASYS) společnosti je prvním komerčně dostupným Ethernetovým paměťovým materiálem, který je speciálně navržen pro řešení核心 problému generativního AI inference: paměťového přístupu.

V době, kdy se AI modely stávají stále složitějšími, kontextově vědomými a trvalými – vyžadující大量 paměti na uživatelskou relaci – EMFASYS nabízí novou přístup k odpojování paměti od výpočtu, což umožňuje AI datovým centerům výrazně zlepšit výkon, snížit náklady a zvýšit využití jejich nejdražších zdrojů: GPU.

Co je paměťový materiál – a proč je důležitý?

Tradičně, paměť uvnitř datových center byla těsně vázaná na server nebo uzel, ve kterém se nachází. Každý GPU nebo CPU má přístup pouze k vysokorychlostní paměti, která je přímo připojena k němu – obvykle HBM pro GPU nebo DRAM pro CPU. Tato architektura funguje dobře, když jsou úkoly malé a předvídatelné. Ale generativní AI změnil hru. LLM vyžadují přístup k velkým kontextovým oknům, uživatelské historii a multi-agent paměti – vše, co musí být zpracováno rychle a bez zpoždění. Tyto paměťové požadavky často překračují dostupnou kapacitu lokální paměti, vytvářejíce úzká místa, která zastavují GPU jádra a zvyšují náklady na infrastrukturu.

Paměťový materiál řeší tento problém tím, že transformuje paměť do sdíleného, distribuovaného zdroje – druhu síťově připojené paměťové paměti, ke které má přístup jakýkoli GPU nebo CPU v clusteru. Myslete si to jako vytvoření “paměťového cloudu” uvnitř datového centra racku. Místo replikace paměti napříč servery nebo přetížení drahé HBM, materiál umožňuje paměti být agregovány, disagregovány a přístupné na vyžádání přes vysokorychlostní síť. To umožňuje AI inference úkoly škálovat více efektivně bez toho, aby byly omezovány fyzickými paměťovými limity jednotlivých uzlů.

Přístup Enfabrica: Ethernet a CXL, společně poprvé

EMFASYS dosahuje této architektury rack-škálovatelné paměti kombinací dvou mocných technologií: RDMA přes Ethernet a Compute Express Link (CXL). První umožňuje ultra-nízké zpoždění, vysokorychlostní přenos dat přes standardní Ethernetové sítě. Druhý umožňuje paměti být odpojeny od CPU a GPU a seskupeny do sdílených zdrojů, přístupných přes vysokorychlostní CXL odkazy.

Ve středu EMFASYS je ACF-S čip Enfabrica, 3,2 terabitů za sekundu (Tbps) “SuperNIC”, který spojuje síťování a paměťovou kontrolu do jednoho zařízení. Tento čip umožňuje serverům rozhraní s obrovskými pooly komoditní DDR5 DRAM – až 18 terabajtů na uzel – distribuovaných napříč rackem. Kriticky, dělá to pomocí standardních Ethernetových portů, což umožňuje operátorům využít svou stávající infrastrukturu datových center bez investic do proprietárních interconnectů.

Co dělá EMFASYS zvláště přesvědčivým, je jeho schopnost dynamicky offloadovat paměťově vázané úkoly z drahé GPU-připojené HBM na mnohem dostupnější DRAM, zatímco zachovává mikrosekundové úrovně přístupového zpoždění. Softwarový stack za EMFASYS zahrnuje inteligentní cache a mechanismy vyvažování zátěže, které skrývají zpoždění a orchestrují pohyb paměti způsoby, které jsou transparentní pro LLM, které běží na systému.

Dopady na AI průmysl

To je více než jen chytré hardwarové řešení – představuje filozofický posun v tom, jak je AI infrastruktura postavena a škálována. Když se generativní AI pohybuje od novinky k nutnosti, s miliardami uživatelských dotazů zpracovávaných denně, náklady na obsluhu těchto modelů se staly nesnesitelnými pro mnoho společností. GPU jsou často nevyužité ne kvůli nedostatku výpočtu, ale protože čekají na paměť. EMFASYS řeší tento nesoulad přímo.

Poskytováním sdílené, materiál-připojené paměti, přístupné přes Ethernet, Enfabrica nabízí operátorům datových center škálovatelnou alternativu k neustálému nákupu dalších GPU nebo HBM. Místo toho mohou zvýšit kapacitu paměti modulárně, pomocí komoditní DRAM a inteligentního síťování, snižují celkovou stopu a zlepšují ekonomiku AI inference.

Dopady jdou za hranice okamžité úspory nákladů. Tento druh disagregované architektury vytváří cestu pro modely paměti jako služby, kde kontext, historie a stav agenta mohou přetrvávat za jednu relaci nebo server, otevírající dveře k více inteligentním a personalizovaným AI systémům. Také vytváří scénu pro více odolné AI cloudy, kde se úkoly mohou distribuovat elasticky napříč rackem nebo celým datovým centrem bez rigidních paměťových omezení.

Pohled do budoucnosti

Enfabrica EMFASYS je aktuálně vzorkován s vybranými zákazníky, a zatímco společnost neuveřejnila, kdo tito partneři jsou, Reuters hlásí, že hlavní AI cloudoví poskytovatelé již testují systém. To позиcionuje Enfabrica nejen jako dodavatele komponent, ale jako klíčového umožňovače v příští generaci AI infrastruktury.

Odpojováním paměti od výpočtu a zpřístupňováním ji napříč vysokorychlostními komoditními Ethernetovými sítěmi, Enfabrica vytváří základ pro novou éru AI architektury – jednu, ve které inference může škálovat bez kompromisů, kde zdroje nejsou již vázány, a kde ekonomika nasazování velkých jazykových modelů konečně začíná dávat smysl.

V světě, který je stále více definován kontextově bohatými, multi-agentními AI systémy, paměť již není podporujícím hercem – je to stage. A Enfabrica sází na to, že ten, kdo postaví nejlepší stage, bude definovat výkon AI po mnoho let.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.