Mô hình và nền tảng AI
CoreWeave kết nối hàng trăm GPU Rubin trong một cụm đa‑rack

CoreWeave vào ngày 16 tháng 9, 2026 đã công bố việc đưa vào hoạt động hệ thống đa‑rack NVIDIA Vera Rubin NVL72 trên CoreWeave Cloud, đưa hàng trăm GPU NVIDIA Rubin vào một cụm mở rộng quy mô duy nhất cho AI tác nhân. Công ty cũng giới thiệu hai khả năng mới trong CoreWeave AI Object Storage: tăng tốc ghi xuyên vùng và tầng Archive mới.
Chen Goldberg, phó chủ tịch điều hành phụ trách sản phẩm và kỹ thuật tại CoreWeave, cho biết CoreWeave là nhà cung cấp đám mây AI đầu tiên xác nhận và đưa vào hoạt động một Vera Rubin NVL72 và chứng minh kiến trúc quy mô rack có thể hoạt động như một dịch vụ đám mây đáng tin cậy, hiệu năng cao. “Với Vera Rubin đa‑rack, chúng tôi đang kết nối hàng trăm GPU Rubin thành một cụm mở rộng quy mô duy nhất,” Goldberg nói, thêm rằng đối với khách hàng xây dựng AI tác nhân, điều này đồng nghĩa với quy mô lớn hơn, vòng lặp nhanh hơn và năng suất cao hơn khi các mô hình và tác nhân liên tục học và cải thiện.
Kiến trúc Đa‑rack và Triển khai
Một rack Vera Rubin NVL72 duy nhất kết hợp 72 GPU Rubin với 36 CPU Vera, NVIDIA NVLink 6, ConnectX-9 SuperNIC và BlueField-4 DPU. Với Vera Rubin đa‑rack NVL72, CoreWeave hợp nhất các rack chứa hàng trăm bộ tăng tốc bằng mạng Ethernet NVIDIA Spectrum‑X thành một cụm mở rộng quy mô duy nhất. CoreWeave cho biết hệ thống cung cấp khả năng đào tạo các mô hình lớn hơn, phục vụ các khối lượng công việc suy luận đòi hỏi cao hơn, và chạy học tăng cường ở quy mô lớn.
Theo công ty, việc chạy các công việc đào tạo và suy luận trên hàng trăm GPU Rubin quan trọng đối với các khối lượng công việc tác nhân đa bước, vốn nhạy cảm với độ trễ truy cập dữ liệu vì các độ trễ có thể tích lũy qua các lần gọi mô hình và sử dụng công cụ lặp lại.
CoreWeave cho biết họ đưa nhiều rack lên hoạt động như một hệ thống duy nhất thông qua kiểm soát vòng đời rack tự động, xác thực cấp hệ thống và mở rộng mạng. CoreWeave Mission Control tự động hoá việc thiết lập rack qua Rack LifeCycle Controller, với các nhiệm vụ thiết lập bao gồm phát hiện phần cứng, cập nhật firmware, xác thực, nguồn điện và làm mát; Racky quản lý điều khiển cấp rack trong khi Valvey thực hiện các hành động làm mát. Trước khi một rack vào sản xuất, CoreWeave kết hợp chẩn đoán hiện trường của NVIDIA với kiểm tra tải công việc toàn rack và so sánh mọi kết quả, và chỉ những rack vượt qua tiêu chuẩn này như một hệ thống mới được đưa vào sản xuất.
Về phía mạng, mỗi GPU Rubin được trang bị hai ConnectX-9 SuperNIC, cung cấp 1.6 Tb/s kết nối mở rộng cho mỗi GPU qua các đường đa‑plane, đa‑rail. CoreWeave cho biết thiết kế hỗ trợ khoảng 128,000 GPU mỗi rail trong một mạng không chặn, và kiến trúc mô-đun cho phép thêm rack mà không cần thiết kế lại mạng ở mỗi lần mở rộng.
Lưu trữ Đối tượng AI Qua Các Vùng
CoreWeave AI Object Storage đưa dữ liệu gần hơn với các khối lượng công việc thông qua LOTA (Local Object Transport Accelerator), áp dụng bộ nhớ đệm quản lý trên mỗi nút CoreWeave Kubernetes Service. CoreWeave cho biết LOTA cung cấp tốc độ đọc ở mức NVMe cục bộ, giảm độ trễ tới 8 lần so với việc đọc từ một cụm lưu trữ truyền thống, và cung cấp tới 7 GB/s thông lượng cho mỗi GPU đồng thời mở rộng tuyến tính khi các cụm tăng trưởng.
Tăng tốc ghi xuyên vùng mới cho phép các checkpoint được ghi cục bộ trong một vùng, với độ trễ cục bộ, trong khi dữ liệu di chuyển sang vùng từ xa thứ hai ở nền. Vì ứng dụng chỉ thấy một bucket duy nhất, không cần thay đổi mã, và các quyền và quy tắc lưu trữ hoạt động giống nhau bất kể checkpoint được ghi từ vùng nào. CoreWeave cho biết tính năng này giảm thiểu thời gian dừng đào tạo và loại bỏ nhu cầu sao chép hoặc di chuyển dữ liệu thủ công giữa các vùng.
Sự bổ sung thứ hai, Archive, là một tầng lưu trữ chi phí thấp hơn, không thu phí khi truy xuất dữ liệu, không thu phí khi xóa sớm và không thu phí khi đọc từ tầng này. CoreWeave mô tả nó được xây dựng cho dữ liệu mà các nhóm nếu không sẽ xóa, chẳng hạn như một checkpoint từ một lần chạy gần như thành công, một bộ dữ liệu cần để tái tạo kết quả, hoặc một phiên bản mô hình mà ai đó có thể hỏi tới sau sáu tháng.
“Các bộ dữ liệu của chúng tôi trải rộng qua nhiều vùng, và chúng tôi không thể chịu được việc lịch đào tạo bị chi phối bởi độ trễ truy xuất xuyên vùng,” Cécile Robert-Michon, giám đốc hạ tầng nội bộ tại Cohere, nói. “CoreWeave AI Object Storage cung cấp cho chúng tôi một footprint dữ liệu thống nhất trên các vùng với các lần đọc được lưu trong bộ nhớ đệm cục bộ, vì vậy không có gì phải chờ đợi trên mạng.”
Thông số kỹ thuật NVIDIA Vera Rubin NVL72
Trang trang sản phẩm Vera Rubin NVL72 của NVIDIA mô tả hệ thống như một siêu máy tính AI tác nhân quy mô rack, được xây dựng trên thiết kế rack MGX NVL72 thế hệ thứ ba và hiện đang sản xuất đầy đủ. Các thông số kỹ thuật do NVIDIA công bố liệt kê 20.7 TB bộ nhớ GPU HBM4 với băng thông 1,400 TB/s, băng thông NVLink 216 TB/s trên NVLink thế hệ thứ sáu, và 3,600 PFLOPS tính toán suy luận NVFP4 thưa thớt mỗi rack. 36 CPU Vera của rack cung cấp 3,168 lõi Olympus tùy chỉnh và lên tới 54 TB bộ nhớ LPDDR5X.
NVIDIA cho biết Vera Rubin NVL72 đào tạo các mô hình mixture-of-experts với một phần tư số lượng GPU so với GB200 NVL72, và cung cấp suy luận với chi phí bằng một phần mười mỗi triệu token cho AI tác nhân tương tác cao, suy luận sâu, với tới 10 lần token hơn mỗi megawatt. Các chú thích trên trang lưu ý rằng các số liệu suy luận có thể thay đổi và so sánh đào tạo là hiệu năng dự kiến.
Trong thông cáo, CoreWeave cũng nhấn mạnh thành tích hiệu năng của mình, trích dẫn kết quả chuẩn MLPerf kỷ lục trong suy luận và huấn luyện, đồng thời là đám mây AI duy nhất đạt xếp hạng Platinum hàng đầu trong cả SemiAnalysis ClusterMAX 1.0 và 2.0. Công ty cũng nêu ra vị trí #1 về tốc độ suy luận và hiệu suất giá cho các mô hình Kimi K2.6 và Kimi K2.7 Code của Moonshot AI trong các bài kiểm tra suy luận độc lập do Artificial Analysis thực hiện.












