Modele i platformy AI
CoreWeave łączy setki GPU Rubin w jednym klastrze wielorackowym

CoreWeave w dniu 16 września 2026 ogłosiła uruchomienie wielorackowego NVIDIA Vera Rubin NVL72 w chmurze CoreWeave, umieszczając setki GPU NVIDIA Rubin w jednym klastrze skalowalnym dla agentowej sztucznej inteligencji. Firma wprowadziła także dwie nowe funkcje w CoreWeave AI Object Storage: przyspieszenie zapisu międzyregionowego oraz nowy poziom Archive.
Chen Goldberg, wiceprezes wykonawczy ds. produktu i inżynierii w CoreWeave, powiedział, że CoreWeave był pierwszym dostawcą chmury AI, który zweryfikował i uruchomił Vera Rubin NVL72 oraz wykazał, że architektura rack‑scale może działać jako niezawodna, wysokowydajna usługa chmurowa. „Dzięki wielorackowemu Vera Rubin łączymy setki GPU Rubin w jednym klastrze skalowalnym”, powiedział Goldberg, dodając, że dla klientów budujących agentową AI oznacza to większą skalę, szybsze iteracje i wyższą produktywność, ponieważ modele i agenci nieustannie się uczą i doskonalą.
Architektura wielorackowa i uruchomienie
Jedna szafa Vera Rubin NVL72 łączy 72 GPU Rubin z 36 procesorami Vera CPU, NVIDIA NVLink 6, kartami ConnectX-9 SuperNIC oraz DPU BlueField‑4. Dzięki wielorackowemu Vera Rubin NVL72, CoreWeave scala szafy setek akceleratorów, wykorzystując sieć Ethernet NVIDIA Spectrum‑X, w jeden klaster skalowalny. CoreWeave twierdzi, że system zapewnia możliwości trenowania większych modeli, obsługi bardziej wymagających zadań inferencyjnych oraz uruchamiania uczenia ze wzmocnieniem w dużej skali.
Według firmy, uruchamianie zadań treningowych i inferencyjnych na setkach GPU Rubin ma znaczenie dla wieloetapowych obciążeń agentowych, które są wrażliwe na opóźnienia dostępu do danych, ponieważ opóźnienia mogą się kumulować przy powtarzalnych wywołaniach modeli i użyciu narzędzi.
CoreWeave poinformował, że uruchamia wiele szaf jako jeden system dzięki zautomatyzowanej kontroli cyklu życia szafy, walidacji na poziomie systemu oraz skalowaniu sieci. CoreWeave Mission Control automatyzuje konfigurację szaf poprzez Rack LifeCycle Controller, obejmując zadania takie jak wykrywanie sprzętu, aktualizacje firmware, walidację, zasilanie i chłodzenie; Racky zarządza kontrolą na poziomie szafy, a Valvey realizuje działania chłodzące. Przed wprowadzeniem szafy do produkcji, CoreWeave łączy diagnostykę terenową NVIDIA z pełnym testowaniem obciążenia szafy i porównuje każdy wynik, a jedynie szafy, które spełnią te kryteria jako system, przechodzą do produkcji.
Po stronie sieciowej każdy GPU Rubin wyposażony jest w dwie karty ConnectX‑9 SuperNIC, zapewniając 1.6 Tb/s łączności skalowalnej na GPU poprzez wieloplanowe, wielotorowe ścieżki. CoreWeave stwierdził, że projekt obsługuje około 128 000 GPU na tor w nieblokującej tkaninie, a modularna topologia umożliwia dodawanie szaf bez konieczności ponownego projektowania tkaniny przy każdej rozbudowie.
Przechowywanie obiektów AI w wielu regionach
CoreWeave AI Object Storage przybliża dane do obciążeń dzięki LOTA (Local Object Transport Accelerator), który stosuje zarządzane buforowanie na każdym węźle CoreWeave Kubernetes Service. CoreWeave twierdzi, że LOTA zapewnia odczyty z prędkością lokalnego NVMe, skraca opóźnienia o 8‑krotnie w porównaniu z odczytem z tradycyjnego klastra pamięci, oraz oferuje do 7 GB/s przepustowości na GPU, skalując się liniowo wraz ze wzrostem klastrów.
Nowe przyspieszenie zapisu międzyregionowego umożliwia zapisywanie punktów kontrolnych lokalnie w obrębie regionu, przy lokalnym opóźnieniu, podczas gdy dane migrują w tle do drugiego zdalnego regionu. Ponieważ aplikacja widzi pojedynczy zasobnik, nie są wymagane zmiany w kodzie, a uprawnienia i zasady retencji działają tak samo, niezależnie od tego, z którego regionu pochodzi zapis. CoreWeave stwierdził, że funkcja minimalizuje przerwy w treningu i eliminuje potrzebę ręcznego kopiowania lub przenoszenia danych między regionami.
Drugim dodatkiem, Archive, jest niżej kosztujący poziom przechowywania bez opłat za pobranie danych, bez opłat za ich wczesne usunięcie oraz bez opłat przy odczycie z tego poziomu. CoreWeave opisuje go jako przeznaczony dla danych, które zespoły w przeciwnym razie usunęłyby, takich jak punkt kontrolny z uruchomienia, które prawie się powiodło, zestaw danych potrzebny do odtworzenia wyniku lub wersja modelu, o którą ktoś może zapytać za sześć miesięcy.
„Nasze zestawy danych rozciągają się na wiele regionów i nie możemy sobie pozwolić, aby nasz harmonogram treningów był determinowany przez opóźnienia w pobieraniu międzyregionowym”, powiedziała Cécile Robert‑Michon, dyrektor ds. wewnętrznej infrastruktury w Cohere. „CoreWeave AI Object Storage zapewnia nam jednolitą strukturę zestawów danych we wszystkich regionach, z odczytami buforowanymi lokalnie, więc nic nie czeka w sieci.”
Specyfikacje NVIDIA Vera Rubin NVL72
Strona produktu Vera Rubin NVL72 firmy NVIDIA opisuje system jako rack‑scale superkomputer AI o charakterze agentowym, oparty na trzeciej generacji projektu szafy MGX NVL72 i będący już w pełnej produkcji. Opublikowane specyfikacje NVIDIA podają 20.7 TB pamięci GPU HBM4 z przepustowością 1 400 TB/s, 216 TB/s przepustowości NVLink szóstej generacji oraz 3 600 PFLOPS rzadkiego obliczenia inferencyjnego NVFP4 na szafę. 36 procesorów Vera CPU w szafie dostarcza 3 168 niestandardowych rdzeni Olympus oraz do 54 TB pamięci LPDDR5X.
NVIDIA podaje, że Vera Rubin NVL72 trenuje modele mieszanki ekspertów przy użyciu jednej czwartej liczby GPU w porównaniu z GB200 NVL72, oraz zapewnia inferencję przy jednej dziesiątej kosztu za milion tokenów dla wysoce interaktywnej, głęboko rozumującej AI agentowej, z nawet 10‑krotnie większą liczbą tokenów na megawat. Przypisy na stronie zaznaczają, że podane wartości inferencji mogą ulec zmianie, a porównanie treningowe jest prognozowaną wydajnością.
W ogłoszeniu CoreWeave również odwołało się do swojego rekordu wydajności, przytaczając rekordowe wyniki benchmarku MLPerf w inferencji i treningu oraz swoją pozycję jako jedynej chmury AI, która uzyskała najwyższą rangę Platinum zarówno w SemiAnalysis ClusterMAX 1.0, jak i 2.0. Firma również przytoczyła pierwsze miejsca w rankingach prędkości inferencji oraz stosunku ceny do wydajności dla modeli Kimi K2.6 i Kimi K2.7 Code firmy Moonshot AI w niezależnym benchmarku inferencji przeprowadzonym przez Artificial Analysis.












