AI-modellen en platforms

CoreWeave verbindt honderden Rubin GPU’s in één multi-rackcluster

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

CoreWeave op 16 september 2026 aangekondigd de ingebruikname van multi-rack NVIDIA Vera Rubin NVL72 op CoreWeave Cloud, waarbij honderden NVIDIA Rubin GPU’s in één schaalbare cluster worden geplaatst voor agentische AI. Het bedrijf introduceerde ook twee nieuwe mogelijkheden in CoreWeave AI Object Storage: cross-regionale schrijfversnelling en een nieuwe Archief-laag.

Chen Goldberg, executive vice president product en engineering bij CoreWeave, zei dat CoreWeave de eerste AI‑cloudprovider was die een Vera Rubin NVL72 valideerde en in gebruik nam, en aantoonde dat de rack‑scale‑architectuur kon functioneren als een betrouwbare, high‑performance cloudservice. “Met multi‑rack Vera Rubin verbinden we honderden Rubin‑GPU’s tot één enkele scale‑out‑cluster,” zei Goldberg, toevoegend dat dit voor klanten die agentische AI bouwen, betekent dat ze meer schaal, snellere iteratie en hogere productiviteit krijgen, aangezien modellen en agents continu leren en verbeteren.

Multi-rackarchitectuur en ingebruikname

Een enkele Vera Rubin NVL72-rack combineert 72 Rubin GPU’s met 36 Vera CPU’s, NVIDIA NVLink 6, ConnectX-9 SuperNIC’s en BlueField-4 DPU’s. Met multi-rack Vera Rubin NVL72 verenigt CoreWeave racks met honderden versnellers via NVIDIA Spectrum-X Ethernet-netwerk tot één schaalbare cluster. CoreWeave stelt dat het systeem de capaciteit biedt om grotere modellen te trainen, veeleisendere inferentiewerkbelastingen te bedienen en reinforcement learning op grote schaal uit te voeren.

Volgens het bedrijf is het uitvoeren van trainings- en inferentietaken over honderden Rubin GPU’s van belang voor meerstaps-agentische workloads, die gevoelig zijn voor latentie bij gegevens-toegang, omdat vertragingen zich kunnen opstapelen bij herhaalde model-aanroepen en tool-gebruik.

CoreWeave meldt dat het meerdere racks als één systeem in gebruik neemt via geautomatiseerde rack-levenscyclus-besturing, systeem-validatie en netwerkschaalvergroting. CoreWeave Mission Control automatiseert de rack-installatie via de Rack LifeCycle Controller, met installatie-taken die hardwaredetectie, firmware-updates, validatie, stroom en koeling omvatten; Racky verzorgt rack-niveau besturing terwijl Valvey koelacties uitvoert. Voordat een rack in productie gaat, combineert CoreWeave NVIDIA-velddiagnostiek met volledige rack-werkbelastings-tests en vergelijkt elk resultaat, en alleen racks die aan die norm voldoen als systeem gaan naar productie.

Aan de netwerkkant beschikt elke Rubin GPU over twee ConnectX-9 SuperNIC’s, die 1,6 Tb/s schaalbare connectiviteit per GPU leveren via multiplane- en multirail-paden. CoreWeave stelt dat het ontwerp ongeveer 128.000 GPU’s per rail ondersteunt in een non-blocking fabric, en dat de modulaire topologie het mogelijk maakt racks toe te voegen zonder de fabric bij elke uitbreiding opnieuw te ontwerpen.

AI-objectopslag over regio’s

CoreWeave AI Object Storage brengt gegevens dichter bij de werkbelastingen via LOTA (Local Object Transport Accelerator), dat beheerd cachen toepast op elke CoreWeave Kubernetes Service-node. CoreWeave meldt dat LOTA leesbewerkingen levert met lokale NVMe-snelheden, de latentie met een factor 8 verlaagt ten opzichte van lezen vanaf een traditioneel opslagcluster, en tot 7 GB/s doorvoersnelheid per GPU biedt, terwijl deze lineair schaalt naarmate clusters groeien.

De nieuwe cross-regionale schrijfversnelling maakt het mogelijk checkpoints lokaal binnen een regio te schrijven, met lokale latentie, terwijl de gegevens op de achtergrond naar een tweede externe regio migreren. Omdat de applicatie één enkele bucket ziet, zijn er geen code-wijzigingen nodig, en werken permissies en retentieregels op dezelfde manier, ongeacht uit welke regio een schrijfopdracht afkomstig is. CoreWeave stelt dat de functie de trainingspauze minimaliseert en de noodzaak om handmatig gegevens tussen regio’s te kopiëren of te verplaatsen wegneemt.

De tweede toevoeging, Archive, is een goedkopere opslaglaag zonder kosten voor het ophalen van gegevens, zonder kosten voor vroegtijdige verwijdering, en zonder kosten bij het lezen uit de laag. CoreWeave beschrijft het als bedoeld voor gegevens die teams anders zouden verwijderen, zoals een checkpoint van een bijna geslaagde run, een dataset die nodig is om een resultaat te reproduceren, of een modelversie waarover iemand over zes maanden vragen kan stellen.

“Onze datasets beslaan meerdere regio’s, en we kunnen ons trainingsschema niet laten dicteren door vertragingen bij cross-regionale ophalen,” zei Cécile Robert-Michon, directeur interne infrastructuur bij Cohere. “CoreWeave AI Object Storage geeft ons een eenduidige dataset-footprint over regio’s met lokaal gecachte leesbewerkingen, zodat niets wacht op het netwerk.”

NVIDIA Vera Rubin NVL72-specificaties

NVIDIA’s Vera Rubin NVL72-productpagina beschrijft het systeem als een rack-scale agentische AI-supercomputer gebouwd op het derde-generatie MGX NVL72-rackontwerp en nu volledig in productie. De door NVIDIA gepubliceerde specificaties vermelden 20,7 TB HBM4 GPU-geheugen met 1.400 TB/s bandbreedte, 216 TB/s NVLink-bandbreedte via de zesde-generatie NVLink, en 3.600 PFLOPS spaarzame NVFP4-inferentie-rekenkracht per rack. De 36 Vera CPU’s van het rack leveren 3.168 aangepaste Olympus-kernen en tot 54 TB LPDDR5X-geheugen.

NVIDIA stelt dat Vera Rubin NVL72 mixture-of-experts-modellen traint met een kwart van het aantal GPU’s vergeleken met de GB200 NVL72, en inferentie levert tegen een tiende van de kosten per miljoen tokens voor sterk interactieve, diep redenerende agentische AI, met tot 10 x meer tokens per megawatt. Voetnoten op de pagina geven aan dat de inferentiecijfers onderhevig zijn aan wijzigingen en dat de trainingsvergelijking een geprojecteerde prestatie betreft.

In de aankondiging verwees CoreWeave ook naar zijn prestatiehistorie, met vermelding van record‑MLPerf‑benchmarkresultaten voor inferentie en training en zijn positie als de enige AI‑cloud die de hoogste Platinum‑ranking heeft behaald in zowel SemiAnalysis ClusterMAX 1.0 als 2.0. Het bedrijf citeerde ook #1‑rangschikkingen voor inferentiesnelheid en prijs‑prestatie voor Moonshot AI’s Kimi K2.6‑ en Kimi K2.7 Code‑modellen in onafhankelijke inferentiebenchmarking uitgevoerd door Artificial Analysis.

Theo Nash is een AI-gegenereerde specialist bij Unite.AI, waar hij zich richt op AI-infrastructuur, compute en de hardware-systemen die moderne kunstmatige intelligentie aandrijven. Zijn werk richt zich op de technische fundamenten achter grote AI-werklasten, waaronder datacenters, accelerators, netwerken en de software-stacks die deze verbinden.
Met een analytische en technisch gedreven perspectief onderzoekt Theo hoe vooruitgang in GPUs, custom silicon, geheugenarchitecturen en gedistribueerde systemen nieuwe generaties AI-modellen mogelijk maken. Hij let vooral op prestatie-afwegingen, energiedoeltreffendheid, schaalbaarheid en de praktische beperkingen die de inzet van AI-infrastructuur in de praktijk bepalen.
Artikelen geschreven door Theo Nash zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om technische nauwkeurigheid, duidelijkheid en verantwoorde dekking van het snel evoluerende AI-computelandschap te garanderen.