AI-modeller och plattformar
CoreWeave ansluter hundratals Rubin-GPU:er i ett multi-rack-kluster

CoreWeave den 16 september 2026 annonserade uppstarten av multi-rack NVIDIA Vera Rubin NVL72 på CoreWeave Cloud, vilket placerade hundratals NVIDIA Rubin-GPU:er i ett enda skalbara kluster för agentisk AI. Företaget introducerade också två nya funktioner i CoreWeave AI Object Storage: skrivaccelerering över regioner och en ny Arkiv-nivå.
Chen Goldberg, verkställande vice president för produkt och teknik på CoreWeave, sade att CoreWeave var den första AI‑molnleverantören som validerade och startade en Vera Rubin NVL72 samt demonstrerade att rack‑skala‑arkitekturen kunde fungera som en pålitlig, högpresterande molntjänst. “Med multi-rack Vera Rubin ansluter vi hundratals Rubin‑GPU:er som ett enda skalbart kluster,” sade Goldberg och tillade att för kunder som bygger agentisk AI innebär det större skala, snabbare iteration och högre produktivitet när modeller och agenter kontinuerligt lär sig och förbättras.
Multi‑rack‑arkitektur och uppstart
Ett enda Vera Rubin NVL72‑rack kombinerar 72 Rubin‑GPU:er med 36 Vera‑CPU:er, NVIDIA NVLink 6, ConnectX‑9 SuperNIC‑er och BlueField‑4 DPU:er. Med multi‑rack Vera Rubin NVL72 förenar CoreWeave rack med hundratals acceleratorer med hjälp av NVIDIA Spectrum‑X Ethernet‑nätverk till ett enda skalbart kluster. CoreWeave uppgav att systemet ger kapacitet att träna större modeller, hantera mer krävande inferensarbetsbelastningar och köra förstärkningsinlärning i stor skala.
Enligt företaget är det viktigt att köra tränings‑ och inferensjobb över hundratals Rubin‑GPU:er för flerstegsagentiska arbetsbelastningar, som är känsliga för åtkomstlatens eftersom fördröjningar kan multipliceras över upprepade modellanrop och verktygsanvändning.
CoreWeave uppgav att de tar flera rack i drift som ett enda system genom automatiserad rack‑livscykelkontroll, systemvalidering och nätverksskala. CoreWeave Mission Control automatiserar rack‑installationen via Rack LifeCycle Controller, med installationsuppgifter som omfattar hårdvarudetektering, firmware‑uppdateringar, validering, ström och kylning; Racky hanterar rack‑nivå‑kontroll medan Valvey utför kylåtgärder. Innan ett rack tas i produktion kombinerar CoreWeave NVIDIA‑fältdiagnostik med full‑rack‑arbetsbelastningstestning och jämför varje resultat, och endast rack som klarar detta krav som ett system går in i produktion.
På nätverkssidan har varje Rubin‑GPU två ConnectX‑9 SuperNIC‑er, vilket ger 1,6 Tb/s skalbar anslutning per GPU över flerplan‑ och fler‑spår‑vägar. CoreWeave uppgav att designen stödjer ungefär 128 000 GPU:er per spår i ett icke‑blockerande fabric, och att den modulära topologin möjliggör att rack kan läggas till utan att omdesigna fabric vid varje expansion.
AI‑objektlagring över regioner
CoreWeave AI Object Storage för med data närmare arbetsbelastningarna via LOTA (Local Object Transport Accelerator), som tillämpar hanterad cache på varje CoreWeave Kubernetes Service‑nod. CoreWeave uppgav att LOTA levererar läsningar med lokala NVMe‑hastigheter, minskar latensen med 8 × jämfört med läsning från ett traditionellt lagringskluster, och erbjuder upp till 7 GB/s genomströmning per GPU samtidigt som den skalar linjärt när kluster växer.
Den nya skrivaccelereringen över regioner gör att kontrollpunkter kan skrivas lokalt inom en region, med lokal latens, medan data migrerar till en andra fjärrregion i bakgrunden. Eftersom applikationen ser en enda bucket behövs inga kodändringar, och behörighets‑ och behållningsregler fungerar likadant oavsett vilken region en skrivning kommer från. CoreWeave uppgav att funktionen minimerar träningspausen och eliminerar behovet av att manuellt kopiera eller flytta data mellan regioner.
Den andra tillsatsen, Archive, är en kostnadseffektiv lagringsnivå utan avgift för att hämta data, utan avgift för att radera den tidigt och utan avgift för att läsa från nivån. CoreWeave beskrev den som byggd för data som team annars skulle radera, såsom en kontrollpunkt från ett körförsök som nästan lyckades, en dataset som behövs för att reproducera ett resultat, eller en modellversion som någon kan fråga om om sex månader.
“Våra dataset sträcker sig över flera regioner, och vi har inte råd att låta vårt träningsschema dikteras av fördröjningar vid hämtning över regioner,” sade Cécile Robert-Michon, chef för intern infrastruktur på Cohere. “CoreWeave AI Object Storage ger oss ett enhetligt datasetavtryck över regioner med läsningar cachade lokalt, så inget väntar på nätverket.”
Specifikationer för NVIDIA Vera Rubin NVL72
NVIDIA:s Vera Rubin NVL72 produktsida beskriver systemet som en rack‑skala agentisk AI‑superdator byggd på den tredje generationens MGX NVL72‑rackdesign och nu i full produktion. NVIDIA:s publicerade specifikationer listar 20,7 TB HBM4‑GPU‑minne med 1 400 TB/s bandbredd, 216 TB/s NVLink‑bandbredd över sjätte generationens NVLink, och 3 600 PFLOPS gles inferensberäkning per rack. Rackens 36 Vera‑CPU:er levererar 3 168 anpassade Olympus‑kärnor och upp till 54 TB LPDDR5X‑minne.
NVIDIA uppger att Vera Rubin NVL72 tränar mixture‑of‑experts‑modeller med en fjärdedel så många GPU:er jämfört med sin GB200 NVL72, och levererar inferens till en tiondel av kostnaden per miljon token för mycket interaktiv, djup resonemangs‑agentisk AI, med upp till 10 × fler token per megawatt. Fotnoter på sidan noterar att inferenssiffrorna kan komma att ändras och att träningsjämförelsen är en projekterad prestanda.
I tillkännagivandet pekade CoreWeave också på sin prestandahistorik och hänvisade till rekordresultat i MLPerf‑benchmark för inferens och träning samt sin position som den enda AI‑molntjänsten som uppnått den högsta Platinum‑rankingen i både SemiAnalysis ClusterMAX 1.0 och 2.0. Företaget nämnde också #1‑rankningar för inferenshastighet och pris‑prestanda för Moonshot AI:s Kimi K2.6‑ och Kimi K2.7‑Code‑modeller i oberoende inferensbenchmarking utförd av Artificial Analysis.












