Modely a platformy AI

WEKA Spouští NeuralMesh 6 a WEKApod 3, Jak se AI Infrastruktura Posouvá k Inferenci

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

WEKA představila koordinovanou aktualizaci softwaru a hardwaru zaměřenou na jeden z nejdražších problémů, které se objevují v odvětví umělé inteligence: udržení produktivity GPU, když se modely přesouvají z fáze trénování do kontinuální, velkého měřítka inference.

Oznámení zahrnuje NeuralMesh 6, významnou aktualizaci datové a paměťové platformy společnosti, spolu s třetím generacím WEKApod zařízeními navržených pro AI cloudy, vývojáře modelů, výzkumné organizace a podniky provozující infrastrukturu GPU.

Společně tyto verze odrážejí širší změnu v návrhu AI infrastruktury, kdy se úložiště vyvíjí z pasivního úložiště do aktivní paměti a datové vrstvy.

Jednotný Pohyb do Produkční AI

Požadavky na infrastrukturu pro AI inference se výrazně liší od těch pro trénování modelů. Trénovací úkoly obvykle zpracovávají velké datové sady prostřednictvím relativně předvídatelných kanálů. Agentic AI, retrieval-augmented generace a systémy dlouhého kontextového rozumu musí naopak přistupovat k měnícím se datům, udržovat kontext napříč opakovanými interakcemi a podporovat mnoho současných uživatelů bez zbytečného čekání drahých GPU.

Odpovědí WEKA je zacházet s úložištěm, rozšířením paměti, přístupem k souborům, přístupem k objektům a pohybem dat jako s částmi stejné platformy. NeuralMesh je navržen tak, aby poskytoval sdílenou datovou základnu pro trénování, inference a vysokovýkonné výpočty napříč prostředími on-premises, veřejnými cloudy a hybridními nasazeními.

Nová verze rozšiřuje tuto architekturu o multi-tenancy, nativní objektové úložiště, distribuované cachování, automatizované snížení dat, operace Kubernetes a centralizovanou pozorovatelnost.

Místo toho, aby společnost prezentovala softwarové a hardwarové oznámení jako nesouvisející aktualizace, prezentuje je jako dvě části stejného systému. NeuralMesh 6 řídí, jak jsou data uložena, přesouvána, izolována a dodávána, zatímco WEKApod 3 poskytuje hardwarový design založený na těchto funkcích.

NeuralMesh 6 Sjednocuje Zátěže Souborů a Objektů

Jedna z důslednějších přidání v NeuralMesh 6 je nativní implementace S3 běžící na úložišti NVMe. Stejné základní datové bloky lze přístupit prostřednictvím protokolů S3 objektového úložiště a rozhraní POSIX nebo Network File System bez udržování samostatných kopií.

To je důležité, protože AI potrubí často přesouvají informace mezi objektovým úložištěm, vysoce výkonnými souborovými systémy, trénovacími prostředími a clusterami inference. Každá kopie spotřebuje kapacitu, zavádí zpoždění a komplikuje správu. Sjednocený namespace by mohl umožnit, aby data vytvořená prostřednictvím jednoho protokolu se stala okamžitě dostupná prostřednictvím jiného.

WEKA uvádí, že jeho implementace podporuje mezi 2 000 a 5 000 současnými S3 připojeními na uzel. Také podporuje S3 přes Remote Direct Memory Access, což umožňuje datům pohybovat se směrem k paměti GPU bez následování konvenční cesty přes několik vrstev CPU a operačního systému.

Platforma zavádí dvě úrovně multi-tenancy. Composable Clusters přidělují vyhrazené procesorové, paměťové a úložné zdroje pro jednotlivé nájemce, zatímco virtuální multi-tenancy poskytuje síťovou izolaci, nezávislé šifrování, samostatné ověřování a řízení kvality služeb pro nájemce.

Virtuální prostředí mohou podporovat více než 1 000 izolovaných nájemců na cluster, podle společnosti. Kombinace fyzického a virtuálního modelu by mohla umožnit velkému provozovateli infrastruktury podporovat desítky tisíc logicky oddělených zákazníků bez nasazení nezávislého clusteru úložiště pro každého z nich.

To je zvláště relevantní pro poskytovatele GPU jako služby a suverénní AI cloudy, které potřebují vyvážit vysokou utilizaci infrastruktury se striktní izolací zákazníků.

Přesun Dat do Míst, Kde Jsou K Dispozici GPU

NeuralMesh 6 také zavádí replikaci na základě metadat a vzdálené cachování pro AI zátěže distribuované napříč datovými centry, cloudy a geografickými regiony.

Tradiční replikace obecně vyžaduje, aby byl celý datový soubor zkopírován, než může začít zátěž. NeuralMesh místo toho činí metadata destinace okamžitě viditelnými a poté přenáší základní data, jak jsou požadována.

To by mohlo umožnit operátorům přesouvat úkoly směrem k dostupné kapacitě GPU bez nutnosti replikovat každý soubor spojený s projektem. Tento přístup je navržen tak, aby podporoval cloud bursting, distribuovanou AI infrastrukturu a spolupráci mezi geograficky oddělenými výzkumnými nebo inženýrskými týmy.

Také představuje ranou fázi směrem k globálnímu namespace modelu, ve kterém lze data adresovat konzistentně bez ohledu na to, kde byly původně uloženy.

Další nová funkce aplikuje fingerprinting, podobnostní hashování, deduplikaci a kompresi kontinuálně, místo aby se data redukce považovala za volitelný pozadí proces.

WEKA tvrdí, že NeuralMesh 6 může poskytnout až šestinásobné úspory kapacity na datech AI trénování s méně než 5% režijními náklady na zápis. Skutečné snížení bude záviset na datové sadě. Kontrolní body, vrstvy kontejnerů, verze modelů a iterativní trénovací data mohou obsahovat významné opakování, zatímco jiné typy dat mohou komprimovat méně efektivně.

Společnost plánuje analyzovat reprezentativní zákaznická data před nasazením a použít výslednou odhad jako součást svých kapacitních a výkonnostních závazků.

Převod Úložiště na Rozšířenou AI Paměťovou Vrstvu

NeuralMesh také zahrnuje WEKA Augmented Memory Grid, který používá úložiště NVMe jako trvalé rozšíření paměti GPU pro inference.

Velké jazykové modely vytvářejí cache klíčových hodnot obsahujících informace vypočtené z podnětu nebo konverzace. Pro dlouhé kontexty a agentic pracovní postupy může tato cache stát extrémně velkou. Když nemůže zůstat v vysoké šířce pásma paměti GPU, systémy mohou potřebovat ji odstranit, přepočítat nebo přesunout do pomalejší infrastruktury.

Augmented Memory Grid ukládá tuto cache do trvalé vrstvy NVMe a používá Remote Direct Memory Access a NVIDIA GPUDirect Storage k přesunu zpět do GPU.

Cílem je zachovat opakovaně použitelný kontext, zatímco se snižuje opakovaná předplnění výpočtu, jedna z nejvíce náročných fází dlouhého kontextového inference.

WEKA uvádí, že testování na Oracle Cloud Infrastructure pomocí NVIDIA H100 GPU vyprodukovalo desetkrát vyšší propustnost tokenů, desetkrát více současných uživatelů a sedmkrát více tokenů na GPU.

Tyto čísla jsou specifickými benchmarky pro zátěž, nikoli univerzálními očekáváními výkonu, ale ilustrují, proč je trvalé řízení cache důležitou součástí návrhu inference infrastruktury.

WEKApod 3 Ovládá Hardwarovou Vrstvu

Zatímco předchozí WEKApod systémy kombinovaly softwar WEKA s předvalidovanými infrastrukturami, třetí generace se posouvá dále do vertikálně integrovaného systémového designu.

WEKA navrhla nový dvou-rack-unit šasi, propojení disků, architekturu chlazení, domény selhání a servisní systém. Zařízení využívají PCI Express Gen 6 interně a NVIDIA (NVDA ) ConnectX síťování pro připojení k infrastruktuře Spectrum-X Ethernet.

Rodina WEKApod se nyní skládá ze tří konfigurovatelných systémů. Nitro je optimalizován pro šířku pásma náročné inference a AI factory zátěže. Prime kombinuje trojúrovňovou buňku a čtyřúrovňovou buňku flash, aby vyvážila výkon a kapacitu. Prime Max priorizuje maximální hustotu úložiště, vejících až 70 NVMe disků do dvou-rack-unit šasi.

Při plné kapacitě racku WEKA uvádí, že Prime Max může poskytnout 441,5 petabytů surové kapacity a 1,1 exabytů efektivní kapacity po redukci dat NeuralMesh. Systém na úrovni racku je ohodnocen na až 10,2 terabytů za sekundu propustnosti a 210 milionů operací vstupu/výstupu za sekundu.

Rozdíl mezi surovou a efektivní kapacitou je důležitý. Exabyte číslo závisí na redukci, která je dosažitelná napříč uloženými daty, a nemělo by se vykládat jako více než exabyte fyzické flash.

Přesto může větší hustota mít významné důsledky ve zařízeních, kde úložiště soutěží s GPU o rack prostor, chlazení a elektrickou kapacitu.

Navrženo Pro Omezená Datová Centra

Nové systémy také řeší fyzické omezení, která se stále více projevují v projektech AI infrastruktury.

GPU klastry vyžadují velké množství elektřiny, chlazení, síťování a podlahového prostoru. Úložné systémy, které spotřebují tyto zdroje neefektivně, mohou snížit počet urychlovačů, které může zařízení podporovat.

WEKA tvrdí, že nová zařízení poskytují 267% větší efektivní kapacitní hustotu a 114% větší výkonovou hustotu než nejbližší veřejně dostupné alternativy ve svých kategoriích.

Společnost také navrhla systémy tak, aby fungovaly v okolní teplotě až 35 stupňů Celsia. Softwarově řízené omezení výkonu je určeno k postupnému snížení výkonu během tepelného stresu, místo aby se spustil.

Bezpečné šasi designu vytváří menší domény selhání, zatímco horkovzdorné boot disky a řízené postupy výměny jsou určeny ke snížení doby údržby. Zákazníci mohou konfigurovat typ šasi, paměť, kapacitu disku a počet disků, s nasazeními sahajícími od méně než jednoho petabytu do více než 100 petabytů.

Stavba Ekosystému Around AI Továrny

Doprovodná oznámení o partnerství naznačují, že platforma bude dostupná zákazníkům prostřednictvím infrastrukturních integrátorů, cloudových poskytovatelů a AI orchestrátorů.

Spectro Cloud позиционирует NeuralMesh jako datovou vrstvu, která může být kombinována s PaletteAI pro nasazení a provoz podnikových AI továren. World Wide Technology a Computacenter plánují zahrnout systémy do širších infrastrukturních projektů, zatímco Glocomp zdůraznil poptávku zákazníků po lepší AI výkonnosti a předvídatelnějších infrastrukturních nákladech.

Tato strategie ekosystému je významná, protože většina organizací nesestavuje produkční AI prostředí z jediného dodavatele.

Typické nasazení může zahrnovat GPU, síťování, úložiště, Kubernetes, model-serving software, pozorovatelnost, zabezpečení a správu produktů z多ných dodavatelů. Společně ověřené konfigurace mohou snížit integrační práci, i když zákazníci budou muset stále testovat výkon pomocí svých vlastních modelů, datových sad, sítí a požadavků na současnou práci.

Co To Znamená Pro AI Infrastrukturu

Nejdůležitějším aspektem oznámení není žádná jednotlivá kapacita nebo číslo propustnosti. Je to rostoucí konvergence úložiště, distribuovaného cachování, správy paměti, mobility dat a izolace nájemců.

Jakmile AI agenti uchovávají delší historii, přistupují k více podnikovým informacím a fungují kontinuálně, infrastruktura obklopující GPU bude stále více určovat náklady na každou užitečnou odpověď.

Přidání více urychlovačů nevyřeší úzká místa způsobená opakovaným zpracováním kontextu, pomalým pohybem dat, fragmentovanými protokoly nebo nevyužitou kapacitou úložiště. Další fáze AI infrastruktury bude tedy záviset stejně na efektivní výživě a správě GPU jako na zvýšení surového výpočtu.

NeuralMesh 6 je naplánován k všeobecné dostupnosti v druhé polovině roku 2026, s existujícími zákazníky, kteří jsou způsobilí k upgrade prostřednictvím standardního softwarového kanálu. Nová zařízení WEKApod Nitro, Prime a Prime Max jsou k dispozici k objednání, s dodávkami, které se očekávají začátkem podzimu 2026.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.