Modele și platforme AI
CoreWeave conectează sute de GPU-uri Rubin într-un singur cluster multi-rack

CoreWeave, pe 16 septembrie 2026, anunță lansarea multi-rack NVIDIA Vera Rubin NVL72 pe CoreWeave Cloud, plasând sute de GPU-uri NVIDIA Rubin într-un singur cluster scalabil pentru AI agentic. Compania a introdus, de asemenea, două noi capabilități în CoreWeave AI Object Storage: accelerare a scrierii transregională și un nou nivel Archive.
Chen Goldberg, vicepreședinte executiv de produs și inginerie la CoreWeave, a declarat că CoreWeave a fost primul furnizor de cloud AI care a validat și a lansat o Vera Rubin NVL72 și a demonstrat că arhitectura la scară de rack poate funcționa ca un serviciu cloud fiabil și cu performanță înaltă. “Cu Vera Rubin multi-rack, conectăm sute de GPU-uri Rubin ca un singur cluster scalabil”, a spus Goldberg, adăugând că pentru clienții care construiesc AI agentic, aceasta înseamnă o scară mai mare, iterații mai rapide și o productivitate mai ridicată, pe măsură ce modelele și agenții învață și se îmbunătățesc continuu.
Arhitectura Multi-Rack și Lansarea
Un singur rack Vera Rubin NVL72 cuple 72 de GPU-uri Rubin cu 36 de CPU-uri Vera, NVIDIA NVLink 6, ConnectX-9 SuperNIC-uri și BlueField-4 DPU-uri. Cu Vera Rubin NVL72 multi-rack, CoreWeave unifică rack-uri cu sute de acceleratoare utilizând rețeaua Ethernet NVIDIA Spectrum-X într-un singur cluster scalabil. CoreWeave a declarat că sistemul oferă capacitatea de a antrena modele mai mari, de a servi sarcini de inferență mai exigente și de a rula învățarea prin recompensă la scară.
Conform companiei, rularea sarcinilor de antrenament și inferență pe sute de GPU-uri Rubin este importantă pentru fluxurile de lucru agentice cu mai mulți pași, care sunt sensibile la latența accesului la date, deoarece întârzierile se pot acumula în urma apelurilor repetate ale modelelor și utilizării instrumentelor.
CoreWeave a declarat că aduce multiple rack-uri la funcționare ca un singur sistem prin control automatizat al ciclului de viață al rack-urilor, validare la nivel de sistem și scalare a rețelei. CoreWeave Mission Control automatizează configurarea rack-urilor prin Rack LifeCycle Controller, cu sarcini de configurare care acoperă detectarea hardware-ului, actualizări de firmware, validare, alimentare și răcire; Racky gestionează controlul la nivel de rack, în timp ce Valvey efectuează acțiuni de răcire. Înainte ca un rack să intre în producție, CoreWeave combină diagnosticele de teren NVIDIA cu testarea sarcinilor pe întregul rack și compară fiecare rezultat, iar doar rack-urile care trec acest prag ca sistem trec în producție.
Din punct de vedere al rețelei, fiecare GPU Rubin dispune de două ConnectX-9 SuperNIC-uri, oferind 1,6 Tb/s de conectivitate scalabilă per GPU prin căi multiplane și multirail. CoreWeave a declarat că designul suportă aproximativ 128,000 de GPU-uri pe rail într-o structură non-blocantă și că topologia modulară permite adăugarea de rack-uri fără a reproiecta structura la fiecare extindere.
Stocare AI de Obiecte în Mai Multe Regiuni
CoreWeave AI Object Storage aduce datele mai aproape de sarcini prin LOTA (Local Object Transport Accelerator), care aplică caching gestionat pe fiecare nod al serviciului CoreWeave Kubernetes. CoreWeave a declarat că LOTA oferă citiri la viteze locale NVMe, reduce latența cu 8 ori comparativ cu citirea dintr-un cluster de stocare tradițional și furnizează până la 7 GB/s de debit per GPU, scalând liniar pe măsură ce cluster-ele cresc.
Noua accelerare a scrierii transregională permite ca punctele de control să fie scrise local într-o regiune, la latență locală, în timp ce datele migrează în fundal către o a doua regiune remote. Deoarece aplicația vede un singur bucket, nu sunt necesare modificări de cod, iar permisiunile și regulile de retenție funcționează la fel, indiferent de regiunea din care provine scrierea. CoreWeave a declarat că funcționalitatea minimizează pauza de antrenament și elimină necesitatea de a copia sau muta manual datele între regiuni.
A doua adiție, Archive, este un nivel de stocare cu costuri reduse, fără taxă pentru recuperarea datelor, fără taxă pentru ștergerea anticipată și fără taxă la citirea din nivel. CoreWeave l-a descris ca fiind conceput pentru date pe care echipele le-ar șterge altfel, cum ar fi un punct de control dintr-o rulare care a funcționat aproape, un set de date necesar pentru reproducerea unui rezultat sau o versiune de model despre care cineva ar putea întreba în șase luni.
„Seturile noastre de date acoperă mai multe regiuni și nu ne putem permite ca programul de antrenament să fie dictat de întârzierile de recuperare transregională”, a declarat Cécile Robert-Michon, directoare a infrastructurii interne la Cohere. „CoreWeave AI Object Storage ne oferă o amprentă unificată a setului de date în toate regiunile, cu citiri cache-uite local, astfel încât nimic să nu aștepte pe rețea.”
Specificații NVIDIA Vera Rubin NVL72
Pagina de produs NVIDIA pagina de produs Vera Rubin NVL72 descrie sistemul ca un supercomputer AI agentic la scară de rack, construit pe designul de rack MGX NVL72 de a treia generație și acum în producție completă. Specificațiile publicate de NVIDIA enumeră 20,7 TB de memorie GPU HBM4 cu 1.400 TB/s de lățime de bandă, 216 TB/s de lățime de bandă NVLink pe NVLink de a șasea generație și 3.600 PFLOPS de calcul inferențial NVFP4 sparsat per rack. Cele 36 de CPU-uri Vera ale rack-ului furnizează 3.168 de nuclee personalizate Olympus și până la 54 TB de memorie LPDDR5X.
NVIDIA afirmă că Vera Rubin NVL72 antrenează modele mixture-of-experts cu un sfert din numărul de GPU-uri comparativ cu GB200 NVL72 și oferă inferență la un zece la sută din costul pe milion de tokeni pentru AI agentic foarte interactiv și cu raționament profund, cu până la de 10 ori mai mulți tokeni pe megawatt. Notele de subsol de pe pagină precizează că cifrele de inferență pot suferi modificări și că comparația de antrenament reprezintă o performanță proiectată.
În anunț, CoreWeave a subliniat, de asemenea, istoricul său de performanță, invocând rezultate record ale benchmark-ului MLPerf în inferență și antrenament și poziția sa ca singurul cloud AI care a obținut clasificarea de top Platinum în ambele versiuni SemiAnalysis ClusterMAX 1.0 și 2.0. Compania a menționat, de asemenea, clasamentele #1 pentru viteza de inferență și raportul preț‑performanță ale modelelor Kimi K2.6 și Kimi K2.7 Code de la Moonshot AI în benchmark-uri independente de inferență realizate de Artificial Analysis.












