Modely a platformy AI

CoreWeave propojuje stovky GPU Rubin v jednom multi‑rackovém clusteru

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

CoreWeave 16. září 2026 oznámila zavedení multi‑rackového NVIDIA Vera Rubin NVL72 na CoreWeave Cloud, umístění stovek GPU NVIDIA Rubin do jediného škálovatelného clusteru pro agentní AI. Společnost také představila dvě nové funkce v CoreWeave AI Object Storage: akceleraci zápisu napříč regiony a novou úroveň Archive.

Chen Goldberg, výkonný viceprezident pro produkty a inženýrství ve společnosti CoreWeave, řekl, že CoreWeave byl první poskytovatel AI cloudu, který ověřil a zprovoznil Vera Rubin NVL72 a prokázal, že architektura na úrovni racku může fungovat jako spolehlivá, vysoce výkonná cloudová služba. „S multi‑rackovým Vera Rubin propojujeme stovky GPU Rubin jako jeden škálovatelný cluster,“ řekl Goldberg a dodal, že pro zákazníky budující agentní AI to znamená větší škálovatelnost, rychlejší iteraci a vyšší produktivitu, protože modely a agenti se neustále učí a zlepšují.

Architektura multi‑rack a zavedení

Jeden rack Vera Rubin NVL72 spojuje 72 GPU Rubin s 36 procesory Vera, NVIDIA NVLink 6, ConnectX-9 SuperNICs a BlueField-4 DPU. S multi‑rackovým Vera Rubin NVL72 CoreWeave sjednocuje racky stovek akcelerátorů pomocí síťování NVIDIA Spectrum‑X Ethernet do jednoho škálovatelného clusteru. CoreWeave uvedl, že systém poskytuje kapacitu pro trénování větších modelů, obsluhu náročnějších inference úloh a provoz reinforcement learningu ve velkém měřítku.

Podle společnosti je provozování tréninkových a inference úloh napříč stovkami GPU Rubin důležité pro vícestupňové agentní pracovní zatížení, které je citlivé na latenci přístupu k datům, protože zpoždění se mohou sčítat při opakovaných voláních modelu a používání nástrojů.

CoreWeave řekl, že spouští více racků jako jeden systém pomocí automatizované správy životního cyklu racku, systémové validace a škálování sítě. CoreWeave Mission Control automatizuje nastavení racku prostřednictvím Rack LifeCycle Controller, přičemž úkoly nastavení zahrnují detekci hardware, aktualizace firmwaru, validaci, napájení a chlazení; Racky řídí úroveň racku, zatímco Valvey provádí chladicí akce. Než rack vstoupí do výroby, CoreWeave kombinuje diagnostiku pole NVIDIA s testováním zatížení celého racku a porovnává každý výsledek, a pouze racky, které tuto úroveň splní jako systém, přecházejí do výroby.

Na síťové straně každý GPU Rubin obsahuje dva ConnectX-9 SuperNICs, poskytující 1,6 Tb/s škálovatelnou konektivitu na GPU napříč víceplánovými, víceželeznými cestami. CoreWeave uvedl, že návrh podporuje přibližně 128 000 GPU na železo v neblokujícím fabricu a že modulární topologie umožňuje přidávat racky bez nutnosti přeprojektování fabricu při každé expanzi.

AI Object Storage napříč regiony

CoreWeave AI Object Storage přibližuje data k pracovním úlohám pomocí LOTA (Local Object Transport Accelerator), která na každém uzlu CoreWeave Kubernetes Service provádí řízené cachování. CoreWeave uvedl, že LOTA poskytuje čtení rychlostí lokálního NVMe, snižuje latenci až 8‑násobně ve srovnání s čtením z tradičního úložného clusteru a poskytuje až 7 GB/s propustnost na GPU při lineárním škálování s růstem clusterů.

Nová akcelerace zápisu napříč regiony umožňuje, aby kontrolní body byly zapisovány lokálně v rámci regionu s lokální latencí, zatímco data se na pozadí migrují do druhého vzdáleného regionu. Protože aplikace vidí jediný bucket, nejsou potřeba žádné změny kódu a oprávnění a pravidla uchování fungují stejně bez ohledu na to, z kterého regionu zápis pochází. CoreWeave uvedl, že tato funkce minimalizuje přerušení tréninku a odstraňuje nutnost ručně kopírovat nebo přesouvat data mezi regiony.

Druhá novinka, Archive, je úložná úroveň s nižšími náklady, která neúčtuje poplatky za načtení dat, za jejich předčasné smazání ani za čtení z úrovně. CoreWeave ji popsal jako určenou pro data, která by týmy jinak smazaly, například kontrolní bod z běhu, který téměř fungoval, datový soubor potřebný k reprodukci výsledku nebo verzi modelu, o kterou se může někdo zajímat za šest měsíců.

„Naše datové sady se rozprostírají napříč regiony a nemůžeme si dovolit, aby náš tréninkový plán byl diktován zpožděním při načítání napříč regiony,“ řekla Cécile Robert-Michon, ředitelka interní infrastruktury ve společnosti Cohere. „CoreWeave AI Object Storage nám poskytuje jednotnou stopu datových sad napříč regiony s lokálně cachovanými čteními, takže nic nečeká na síti.“

Specifikace NVIDIA Vera Rubin NVL72

NVIDIA stránka produktu Vera Rubin NVL72 popisuje systém jako rack‑scale superpočítač pro agentní AI postavený na třetí generaci designu racku MGX NVL72 a nyní v plné výrobě. Publikované specifikace NVIDIA uvádějí 20,7 TB paměti HBM4 GPU s šířkou pásma 1 400 TB/s, 216 TB/s šířky pásma NVLink šesté generace a 3 600 PFLOPS řídkého výpočetního výkonu NVFP4 inference na rack. Rackových 36 procesorů Vera poskytuje 3 168 vlastních jader Olympus a až 54 TB paměti LPDDR5X.

NVIDIA uvádí, že Vera Rubin NVL72 trénuje modely mixture‑of‑experts s čtvrtinou počtu GPU ve srovnání s GB200 NVL72 a poskytuje inference za desetinu nákladů na milion tokenů pro vysoce interaktivní, hluboké uvažování agentní AI, s až 10‑násobně vyšším počtem tokenů na megawatt. Poznámky pod čarou na stránce uvádějí, že inferenční údaje se mohou změnit a že srovnání tréninku představuje odhadovaný výkon.

V oznámení CoreWeave také poukázal na své výkonnostní záznamy, přičemž citoval rekordní výsledky benchmarku MLPerf v inferenci i tréninku a svou pozici jako jediný AI cloud, který získal nejvyšší Platinum hodnocení jak v SemiAnalysis ClusterMAX 1.0, tak i 2.0. Společnost také uvedla, že modely Kimi K2.6 a Kimi K2.7 Code od Moonshot AI dosáhly první místa v hodnocení rychlosti inferencí a poměru cena/výkon v nezávislém benchmarkingu inferencí provedeném společností Artificial Analysis.

Theo Nash je specialista na umělou inteligenci vygenerovaný v Unite.AI, který se zabývá infrastrukturou umělé inteligence, výpočetními systémy a hardwarovými systémy, které pohánějí moderní umělou inteligenci. Jeho práce se zaměřuje na technické základy velkých AI úloh, včetně datových center, akcelerátorů, sítí a softwarových balíčků, které je spojují.
S analytickým a inženýrským přístupem Theo zkoumá, jak pokroky v oblasti GPU, vlastních polovodičových součástek, architektur paměti a distribuovaných systémů umožňují nové generace AI modelů. Zvláštní pozornost věnuje obchodním kompromisům, energetické eficienci, škálovatelnosti a praktickým omezením, které formují reálné nasazení AI infrastruktury.
Články napsané Theo Nashem jsou vygenerovány umělou inteligencí a recenzovány redakčním týmem Unite.AI, aby zajistily technickou přesnost, srozumitelnost a zodpovědné pokrytí rychle se vyvíjejícího AI výpočetního prostředí.