AI-modeller og plattformer
CoreWeave kobler hundrevis av Rubin‑GPUer i én multi‑rack‑klynge

CoreWeave den 16. september 2026 kunngjorde oppstarten av multi‑rack NVIDIA Vera Rubin NVL72 på CoreWeave Cloud, og plasserer hundrevis av NVIDIA Rubin‑GPUer i én enkelt skalerende klynge for agentisk AI. Selskapet introduserte også to nye funksjoner i CoreWeave AI Object Storage: skrivetilslutning på tvers av regioner og et nytt Arkiv‑nivå.
Chen Goldberg, executive vice president for produkt og engineering i CoreWeave, sa at CoreWeave var den første AI‑skyleverandøren som validerte og satte i drift en Vera Rubin NVL72, og demonstrerte at rack‑skala‑arkitekturen kunne fungere som en pålitelig, høyytelses skytjeneste. «Med multi‑rack Vera Rubin kobler vi sammen hundrevis av Rubin‑GPUer som en enkelt scale‑out‑klynge», sa Goldberg, og la til at for kunder som bygger agentisk AI betyr dette større skala, raskere iterasjon og høyere produktivitet ettersom modeller og agenter kontinuerlig lærer og forbedrer seg.
Multi‑rack‑arkitektur og oppstart
Et enkelt Vera Rubin NVL72‑rack kombinerer 72 Rubin‑GPUer med 36 Vera‑CPUer, NVIDIA NVLink 6, ConnectX‑9 SuperNIC‑er og BlueField‑4 DPU‑er. Med multi‑rack Vera Rubin NVL72 forener CoreWeave rack med hundrevis av akseleratorer ved hjelp av NVIDIA Spectrum‑X Ethernet‑nettverk til én enkelt skalerende klynge. CoreWeave opplyser at systemet gir kapasitet til å trene større modeller, betjene mer krevende inferens‑arbeidsbelastninger og kjøre forsterkende læring i stor skala.
Ifølge selskapet er kjøring av trenings‑ og inferens‑jobber på tvers av hundrevis av Rubin‑GPUer viktig for flertrinns agentiske arbeidsbelastninger, som er følsomme for data‑tilgangslatens fordi forsinkelser kan akkumulere over gjentatte modell‑kall og verktøybruk.
CoreWeave opplyser at de setter flere rack i drift som ett system gjennom automatisert rack‑livssyklus‑kontroll, systemnivå‑validering og nettverks‑skalering. CoreWeave Mission Control automatiserer rack‑oppsett via Rack LifeCycle Controller, med oppgaver som omfatter maskinvare‑deteksjon, fastvare‑oppdateringer, validering, strøm og kjøling; Racky håndterer rack‑nivå‑kontroll mens Valvey utfører kjølings‑handlinger. Før et rack tas i produksjon, kombinerer CoreWeave NVIDIA‑feltdiagnostikk med full‑rack arbeidsbelastningstesting og sammenligner hvert resultat, og kun rack som oppfyller dette kravet som et system, går videre til produksjon.
På nettverksiden har hver Rubin‑GPU to ConnectX‑9 SuperNIC‑er, som gir 1,6 Tb/s skalerende tilkobling per GPU over flerplan‑ og fler‑rail‑baner. CoreWeave opplyser at designet støtter omtrent 128 000 GPUer per rail i et ikke‑blokerende nettverk, og at den modulære topologien gjør det mulig å legge til rack uten å redesigne nettverket ved hver utvidelse.
AI‑objektlagring på tvers av regioner
CoreWeave AI Object Storage bringer data nærmere arbeidsbelastningene via LOTA (Local Object Transport Accelerator), som bruker administrert caching på hver CoreWeave Kubernetes Service‑node. CoreWeave opplyser at LOTA leverer lesninger med lokale NVMe‑hastigheter, reduserer latensen med 8‑ganger sammenlignet med lesing fra en tradisjonell lagringsklynge, og gir opptil 7 GB/s gjennomstrømning per GPU mens den skalerer lineært etter hvert som klynger vokser.
Den nye skrivetilslutningen på tvers av regioner gjør at sjekkpunkter kan skrives lokalt innenfor en region, med lokal latens, mens dataene migrerer til en annen ekstern region i bakgrunnen. Fordi applikasjonen ser én enkelt bøtte, kreves ingen kodeendringer, og tillatelser og lagringsregler fungerer likt uavhengig av hvilken region en skriving kommer fra. CoreWeave opplyser at funksjonen minimerer treningspausen og fjerner behovet for manuelt å kopiere eller flytte data mellom regioner.
Den andre tilleggsfunksjonen, Archive, er et lavkost‑lagernivå uten gebyr for å hente data, uten gebyr for tidlig sletting, og uten gebyr ved lesing fra nivået. CoreWeave beskriver det som bygget for data som team ellers ville slette, for eksempel et sjekkpunkt fra en kjøring som nesten fungerte, et datasett som trengs for å gjenskape et resultat, eller en modellversjon noen kan spørre om om seks måneder.
«Datasettene våre spenner over flere regioner, og vi har ikke råd til at treningsplanen vår blir diktert av forsinkelser ved henting på tvers av regioner», sa Cécile Robert-Michon, direktør for intern infrastruktur i Cohere. «CoreWeave AI Object Storage gir oss et samlet datasett‑avtrykk på tvers av regioner med lesninger cachet lokalt, så ingenting venter på nettverket.»
NVIDIA Vera Rubin NVL72‑spesifikasjoner
NVIDIAs Vera Rubin NVL72 produktside beskriver systemet som en rack‑skala agentisk AI‑superdatamaskin bygget på tredje‑generasjons MGX NVL72‑rack‑design og nå i full produksjon. NVIDIAs publiserte spesifikasjoner oppgir 20,7 TB HBM4 GPU‑minne med 1 400 TB/s båndbredde, 216 TB/s NVLink‑båndbredde over sjette‑generasjons NVLink, og 3 600 PFLOPS sparsom NVFP4‑inferens‑beregning per rack. Rackens 36 Vera‑CPUer leverer 3 168 tilpassede Olympus‑kjerner og opptil 54 TB LPDDR5X‑minne.
NVIDIA oppgir at Vera Rubin NVL72 trener mixture‑of‑experts‑modeller med en fjerdedel så mange GPUer sammenlignet med sin GB200 NVL72, og leverer inferens til en tidel av kostnaden per million token for svært interaktiv, dypt resonnerende agentisk AI, med opptil 10‑ganger flere token per megawatt. Fotnoter på siden bemerker at inferens‑tallene kan endres og at trenings‑sammenligningen er en projisert ytelse.
I kunngjøringen pekte CoreWeave også på sin ytelsesrekord, og henviste til rekordresultater i MLPerf‑benchmark for inferens og trening, samt sin posisjon som den eneste AI‑skyen som har oppnådd den høyeste Platinum‑rangeringen i både SemiAnalysis ClusterMAX 1.0 og 2.0. Selskapet refererte også til rangeringer som nummer 1 for inferenshastighet og pris‑ytelse for Moonshot AI sine Kimi K2.6‑ og Kimi K2.7‑Code‑modeller i uavhengig inferens‑benchmarking utført av Artificial Analysis.












