AI-modeller og platforme
CoreWeave forbinder hundreder af Rubin GPU’er i én multi‑rack‑klynge

CoreWeave den 16. september 2026 annoncerede opsætningen af multi‑rack NVIDIA Vera Rubin NVL72 på CoreWeave Cloud, som placerer hundreder af NVIDIA Rubin GPU’er i en enkelt skalerbar klynge til agentisk AI. Virksomheden introducerede også to nye funktioner i CoreWeave AI Object Storage: cross‑region skriveacceleration og et nyt Archive‑lag.
Chen Goldberg, chefvicepræsident for produkt og ingeniørvidenskab hos CoreWeave, sagde, at CoreWeave var den første AI-cloududbyder, der validerede og implementerede en Vera Rubin NVL72 og demonstrerede, at rack-skala-arkitekturen kunne fungere som en pålidelig, højtydende cloud-tjeneste. “Med multi-rack Vera Rubin forbinder vi hundredvis af Rubin-GPU’er som en enkelt scale-out-klynge,” sagde Goldberg, og tilføjede, at for kunder, der bygger agentisk AI, betyder det større skala, hurtigere iteration og højere produktivitet, da modeller og agenter kontinuerligt lærer og forbedrer sig.
Multi‑rack‑arkitektur og opsætning
Et enkelt Vera Rubin NVL72‑rack kombinerer 72 Rubin GPU’er med 36 Vera CPU’er, NVIDIA NVLink 6, ConnectX‑9 SuperNIC’er og BlueField‑4 DPU’er. Med multi‑rack Vera Rubin NVL72 forener CoreWeave racks med hundreder af acceleratorer ved hjælp af NVIDIA Spectrum‑X Ethernet‑netværk i en enkelt skalerbar klynge. CoreWeave sagde, at systemet leverer kapaciteten til at træne større modeller, betjene mere krævende inferens‑arbejdsbelastninger og køre forstærkningslæring i stor skala.
Ifølge virksomheden er kørsel af trænings‑ og inferens‑jobs på tværs af hundreder af Rubin GPU’er vigtigt for multi‑step agentiske arbejdsbelastninger, som er følsomme over for datatilgangslatens, fordi forsinkelser kan ophobes over gentagne model‑kald og værktøjsbrug.
CoreWeave sagde, at de bringer flere racks i drift som ét system gennem automatiseret rack‑livscyklus‑styring, system‑niveau validering og netværksskalerering. CoreWeave Mission Control automatiserer rack‑opsætning via Rack LifeCycle Controller, med opsætningsopgaver der spænder over hardware‑detektion, firmware‑opdateringer, validering, strøm og køling; Racky håndterer rack‑niveau styring mens Valvey udfører kølingshandlinger. Før et rack går i produktion kombinerer CoreWeave NVIDIA‑felt‑diagnostik med fuld‑rack‑arbejdsbelastningstest og sammenligner hvert resultat, og kun de racks, der opfylder kravet som system, flyttes i produktion.
På netværkssiden har hver Rubin GPU to ConnectX‑9 SuperNIC’er, som leverer 1,6 Tb/s skalerbar forbindelse pr. GPU over multiplane‑ og multirail‑stier. CoreWeave sagde, at designet understøtter cirka 128.000 GPU’er pr. rail i et non‑blocking‑fabric, og at den modulære topologi tillader, at racks kan tilføjes uden at redesigne fabric’en ved hver udvidelse.
AI‑objektlagring på tværs af regioner
CoreWeave AI Object Storage bringer data tættere på arbejdsbelastninger via LOTA (Local Object Transport Accelerator), som anvender administreret caching på hver CoreWeave Kubernetes Service‑node. CoreWeave sagde, at LOTA leverer læsninger med lokale NVMe‑hastigheder, reducerer latensen med 8‑fold i forhold til læsning fra et traditionelt lagerklynge, og giver op til 7 GB/s gennemløb pr. GPU, mens den skalerer lineært efterhånden som klynger vokser.
Den nye cross‑region skriveacceleration gør det muligt at skrive checkpoints lokalt inden for en region med lokal latenstid, mens dataene migrerer til en anden fjernregion i baggrunden. Da applikationen ser kun én bucket, er der ingen kodeændringer, og tilladelser samt opbevaringsregler fungerer ens uanset hvilken region en skrivning stammer fra. CoreWeave sagde, at funktionen minimerer træningspausen og fjerner behovet for manuelt at kopiere eller flytte data mellem regioner.
Den anden tilføjelse, Archive, er et lavpris‑lagringsniveau uden gebyr for at hente data, uden gebyr for tidlig sletning og uden gebyr ved læsning fra laget. CoreWeave beskrev det som bygget til data, som teams ellers ville slette, såsom et checkpoint fra et kørsel, der næsten virkede, et datasæt nødvendigt for at reproducere et resultat, eller en modelversion, som nogen kan spørge om om seks måneder.
“Vores datasæt spænder over flere regioner, og vi har ikke råd til, at vores træningsplan dikteres af cross‑region‑hentningsforsinkelser,” sagde Cécile Robert-Michon, director of internal infrastructure hos Cohere. “CoreWeave AI Object Storage giver os et samlet datasæt‑aftryk på tværs af regioner med læsninger cachet lokalt, så intet venter på netværket.”
NVIDIA Vera Rubin NVL72 specifikationer
NVIDIA’s Vera Rubin NVL72 produktside beskriver systemet som en rack‑scale agentisk AI supercomputer bygget på den tredje‑generations MGX NVL72 rack‑design og nu i fuld produktion. NVIDIA’s offentliggjorte specifikationer angiver 20,7 TB HBM4 GPU‑hukommelse med 1 400 TB/s båndbredde, 216 TB/s NVLink‑båndbredde over sjette‑generations NVLink, og 3 600 PFLOPS sparsom NVFP4 inferens‑beregning pr. rack. Rack’ets 36 Vera CPU’er leverer 3 168 specialtilpassede Olympus‑kerner og op til 54 TB LPDDR5X‑hukommelse.
NVIDIA oplyser, at Vera Rubin NVL72 træner mixture‑of‑experts‑modeller med en fjerdedel så mange GPU’er sammenlignet med sin GB200 NVL72, og leverer inferens til en tiendedel af omkostningerne pr. million tokens for højt interaktiv, dyb‑reasoning agentisk AI, med op til 10‑gange flere tokens pr. megawatt. Fodnoter på siden bemærker, at inferens‑tallene kan ændres, og at træningssammenligningen er en projiceret ydelse.
I meddelelsen pegede CoreWeave også på sin præstationshistorik og henviste til rekordresultater i MLPerf-benchmarken for inferens og træning samt sin position som den eneste AI‑cloud, der har opnået den højeste Platinum‑rangering i både SemiAnalysis ClusterMAX 1.0 og 2.0. Virksomheden nævnte også, at den har #1‑placeringer for inferenshastighed og pris‑performance for Moonshot AI’s Kimi K2.6‑ og Kimi K2.7‑Code‑modeller i uafhængig inferensbenchmark udført af Artificial Analysis.












