Model dan platform AI

CoreWeave Menghubungkan Ratusan GPU Rubin dalam Satu Klaster Multi-Rak

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

CoreWeave pada 16 September 2026 mengumumkan peluncuran multi-rak NVIDIA Vera Rubin NVL72 di CoreWeave Cloud, menempatkan ratusan GPU NVIDIA Rubin ke dalam satu klaster skala-out untuk AI agenik. Perusahaan juga memperkenalkan dua kemampuan baru dalam CoreWeave AI Object Storage: percepatan penulisan lintas wilayah dan tingkat Arsip baru.

Chen Goldberg, wakil presiden eksekutif produk dan rekayasa di CoreWeave, mengatakan CoreWeave adalah penyedia cloud AI pertama yang memvalidasi dan meluncurkan Vera Rubin NVL72 serta menunjukkan bahwa arsitektur skala-rak dapat beroperasi sebagai layanan cloud yang andal dan berperforma tinggi. “Dengan Vera Rubin multi-rak, kami menghubungkan ratusan GPU Rubin sebagai satu klaster skala-out,” kata Goldberg, menambahkan bahwa bagi pelanggan yang membangun AI agenik, hal itu berarti skala yang lebih besar, iterasi yang lebih cepat, dan produktivitas yang lebih tinggi karena model dan agen terus belajar dan berkembang.

Arsitektur Multi-Rak dan Peluncuran

Satu rak Vera Rubin NVL72 menggabungkan 72 GPU Rubin dengan 36 CPU Vera, NVIDIA NVLink 6, ConnectX-9 SuperNIC, dan BlueField-4 DPU. Dengan Vera Rubin multi-rak NVL72, CoreWeave menyatukan rak berisi ratusan akselerator menggunakan jaringan Ethernet NVIDIA Spectrum-X menjadi satu klaster skala-out. CoreWeave mengatakan sistem ini menyediakan kapasitas untuk melatih model yang lebih besar, melayani beban kerja inferensi yang lebih menuntut, dan menjalankan pembelajaran penguatan pada skala besar.

Menurut perusahaan, menjalankan pekerjaan pelatihan dan inferensi pada ratusan GPU Rubin penting untuk beban kerja agenik multi-langkah, yang sensitif terhadap latensi akses data karena penundaan dapat terakumulasi pada pemanggilan model dan penggunaan alat yang berulang.

CoreWeave mengatakan bahwa ia mengaktifkan beberapa rak menjadi satu sistem melalui kontrol siklus hidup rak otomatis, validasi tingkat sistem, dan penskalaan jaringan. CoreWeave Mission Control mengotomatisasi penyiapan rak melalui Rack LifeCycle Controller, dengan tugas penyiapan yang mencakup deteksi perangkat keras, pembaruan firmware, validasi, daya, dan pendinginan; Racky menangani kontrol tingkat rak sementara Valvey melaksanakan tindakan pendinginan. Sebelum sebuah rak masuk produksi, CoreWeave menggabungkan diagnostik lapangan NVIDIA dengan pengujian beban kerja penuh rak dan membandingkan setiap hasil, dan hanya rak yang memenuhi standar tersebut sebagai sistem yang masuk produksi.

Di sisi jaringan, setiap GPU Rubin dilengkapi dua ConnectX-9 SuperNIC, menyediakan 1,6 Tb/s konektivitas skala-out per GPU melalui jalur multiplane dan multirail. CoreWeave mengatakan desain ini mendukung sekitar 128.000 GPU per rail dalam jaringan non-blocking, dan topologi modular memungkinkan penambahan rak tanpa harus merancang ulang jaringan pada setiap ekspansi.

Penyimpanan Objek AI Lintas Wilayah

CoreWeave AI Object Storage mendekatkan data ke beban kerja melalui LOTA (Local Object Transport Accelerator), yang menerapkan caching terkelola pada setiap node CoreWeave Kubernetes Service. CoreWeave mengatakan LOTA memberikan pembacaan dengan kecepatan NVMe lokal, mengurangi latensi hingga 8 kali dibandingkan membaca dari klaster penyimpanan tradisional, dan menyediakan hingga 7 GB/detik throughput per GPU sambil berskala linear seiring pertumbuhan klaster.

Percepatan penulisan lintas wilayah yang baru memungkinkan checkpoint ditulis secara lokal dalam satu wilayah, dengan latensi lokal, sementara data bermigrasi ke wilayah remote kedua di latar belakang. Karena aplikasi melihat satu bucket, tidak ada perubahan kode, dan izin serta aturan retensi berfungsi sama terlepas dari wilayah asal penulisan. CoreWeave mengatakan fitur ini meminimalkan jeda pelatihan dan menghilangkan kebutuhan untuk menyalin atau memindahkan data secara manual antar wilayah.

Penambahan kedua, Arsip, adalah tingkat penyimpanan berbiaya lebih rendah tanpa biaya untuk mengambil data, tanpa biaya untuk menghapusnya lebih awal, dan tanpa biaya saat membaca dari tingkat tersebut. CoreWeave menggambarkannya sebagai dirancang untuk data yang biasanya tim hapus, seperti checkpoint dari percobaan yang hampir berhasil, dataset yang diperlukan untuk mereproduksi hasil, atau versi model yang mungkin diminta dalam enam bulan.

“Dataset kami tersebar di beberapa wilayah, dan kami tidak dapat membiarkan jadwal pelatihan kami ditentukan oleh penundaan pengambilan lintas wilayah,” kata Cécile Robert-Michon, direktur infrastruktur internal di Cohere. “CoreWeave AI Object Storage memberi kami jejak dataset terpadu di seluruh wilayah dengan pembacaan yang di-cache secara lokal, sehingga tidak ada yang menunggu jaringan.”

Spesifikasi NVIDIA Vera Rubin NVL72

Halaman produk halaman produk Vera Rubin NVL72 milik NVIDIA menjelaskan sistem ini sebagai superkomputer AI agenik skala-rak yang dibangun di atas desain rak MGX NVL72 generasi ketiga dan kini dalam produksi penuh. Spesifikasi yang dipublikasikan NVIDIA mencantumkan 20,7 TB memori GPU HBM4 dengan bandwidth 1.400 TB/detik, bandwidth NVLink 216 TB/detik melalui NVLink generasi keenam, dan 3.600 PFLOPS komputasi inferensi NVFP4 sparse per rak. 36 CPU Vera pada rak menyediakan 3.168 inti Olympus khusus dan hingga 54 TB memori LPDDR5X.

NVIDIA menyatakan bahwa Vera Rubin NVL72 melatih model mixture-of-experts dengan seperempat jumlah GPU dibandingkan GB200 NVL72-nya, dan memberikan inferensi dengan biaya satu persepuluh per juta token untuk AI agenik yang sangat interaktif dan penalaran mendalam, dengan hingga 10 kali lebih banyak token per megawatt. Catatan kaki pada halaman tersebut mencatat bahwa angka inferensi dapat berubah dan bahwa perbandingan pelatihan merupakan perkiraan kinerja.

Dalam pengumuman tersebut, CoreWeave juga menyoroti catatan kinerjanya, dengan menyebutkan hasil benchmark MLPerf yang memecahkan rekor dalam inferensi dan pelatihan serta posisinya sebagai satu‑satunya cloud AI yang memperoleh peringkat Platinum tertinggi pada SemiAnalysis ClusterMAX 1.0 dan 2.0. Perusahaan juga mencantumkan peringkat #1 untuk kecepatan inferensi dan price‑performance model Kimi K2.6 dan Kimi K2.7 Code dari Moonshot AI dalam benchmark inferensi independen yang dilakukan oleh Artificial Analysis.

Theo Nash adalah seorang spesialis yang dihasilkan oleh AI di Unite.AI, yang meliputi infrastruktur AI, komputasi, dan sistem perangkat keras yang memungkinkan kecerdasan buatan modern. Pekerjaannya berfokus pada fondasi teknis di balik beban kerja AI skala besar, termasuk pusat data, akselerator, jaringan, dan tumpukan perangkat lunak yang menghubungkannya.
Dengan perspektif analitis dan berbasis teknik, Theo memeriksa bagaimana kemajuan dalam GPU, silikon kustom, arsitektur memori, dan sistem terdistribusi memungkinkan generasi baru model AI. Ia memperhatikan khusus pada pertukaran kinerja, efisiensi energi, skalabilitas, dan kendala praktis yang membentuk penerapan infrastruktur AI di dunia nyata.
Artikel yang ditulis oleh Theo Nash dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi teknis, kejelasan, dan liputan yang bertanggung jawab atas lanskap komputasi AI yang berkembang pesat.