Mô hình và nền tảng AI
NVIDIA Vera Rubin NVL72 công bố kết quả xem trước MLPerf Inference đầu tiên

Vào ngày 16 tháng 9 năm 2026, NVIDIA đã công bố kết quả nộp MLPerf Inference v6.1, với tiêu đề là lần nộp xem trước MLPerf Inference đầu tiên của hệ thống Vera Rubin NVL72, công ty cho biết hệ thống này đạt tốc độ thông lượng cao hơn tới 3,7 lần so với hệ thống GB300 NVL72 trên bộ chuẩn Qwen3-VL.
MLPerf Inference: Datacenter là một bộ chuẩn của Hiệp hội MLCommons đo lường tốc độ hệ thống xử lý đầu vào và tạo ra kết quả bằng mô hình đã được huấn luyện. Theo định nghĩa đã công bố của MLCommons, hạng Closed — danh mục mà NVIDIA đã trích dẫn cho các số liệu tiêu đề — yêu cầu sử dụng cùng một mô hình như triển khai tham chiếu để các nền tảng phần cứng và khung phần mềm có thể so sánh “tương đương,” trong khi các hệ thống thuộc danh mục khả dụng Preview phải có thể nộp dưới dạng Available trong vòng nộp tiếp theo.
Kết quả xem trước DeepSeek-R1 và Qwen3-VL
NVIDIA đã nộp kết quả xem trước Vera Rubin NVL72 trên DeepSeek-R1 và Qwen3-VL, mà công ty mô tả là hai trong số các bộ chuẩn đòi hỏi cao nhất trong bộ v6.1. Trên Qwen3-VL, công ty báo cáo tốc độ thông lượng cao hơn tới 3,7 lần so với GB300 NVL72 trong các kịch bản offline, server và interactive, sử dụng vLLM cùng khung suy luận mã nguồn mở NVIDIA Dynamo. Trên DeepSeek-R1, sử dụng thư viện NVIDIA TensorRT-LLM, NVIDIA báo cáo tốc độ thông lượng cao hơn tới 2,5 lần so với GB300 NVL72.
Các số liệu hạng Closed được trích dẫn đã được lấy từ mlcommons.org vào ngày 16 tháng 9 năm 2026, và dựa trên các mục nộp 6.1-0106 và 6.1-0074, theo trích dẫn được công bố cùng với kết quả. NVIDIA cho biết hiệu năng này có nghĩa là mỗi rack Vera Rubin NVL72 cung cấp số lượng token đáng kể hơn, phục vụ nhiều người dùng hơn và tạo ra doanh thu cao hơn so với rack GB300 NVL72, đồng thời giảm chi phí trên mỗi token.
Nebius cũng đã nộp kết quả xem trước Vera Rubin NVL72 trong cùng vòng; NVIDIA mô tả các kết quả đó là thể hiện hiệu năng xuất sắc.
Thiết kế đồng bộ phần cứng-phần mềm và Kiểm tra Agentic
NVIDIA ghi nhận thiết kế đồng bộ toàn stack trên phần cứng và phần mềm là nguyên nhân cho các kết quả này. Công ty cho biết Tensor Cores và Transformer Engine được cải tiến của Vera Rubin tăng tốc cả giai đoạn prefill và decode trong suy luận, trong khi độ chính xác NVFP4 giảm dung lượng bộ nhớ của trọng số mô hình, attention và bộ nhớ KV cache, nâng cao thông lượng với mức mất chất lượng đầu ra tối thiểu theo mô tả của NVIDIA.
Các bản nộp sử dụng kiến trúc phục vụ tách rời, tách riêng prefill và decode, kết hợp với song song chuyên gia quy mô lớn trên các lớp mixture-of-experts được các mô hình như DeepSeek-R1 và Qwen3-VL sử dụng. NVIDIA cho biết miền mở rộng NVL72, được xây dựng trên NVLink thế hệ thứ sáu và NVLink Switch, cung cấp tốc độ gói tin cao hơn 10 lần và độ trễ thấp hơn 3 lần so với Ethernet thông thường, tạo nền tảng kết nối cho các kỹ thuật này ở quy mô rack.
Công ty cũng báo cáo rằng Vera Rubin NVL72 đạt hiệu năng tốt hơn 30 lần so với GB300 NVL72 trong thử nghiệm xem trước trên bộ chuẩn SemiAnalysis AgentX, được thiết kế để đo lường các khối lượng công việc agentic. NVIDIA cho biết bộ chuẩn MLPerf Endpoints sắp tới sẽ mang lại đo lường tiêu chuẩn cho các khối lượng công việc suy luận agentic, vượt qua những gì các bộ chuẩn thông lượng truyền thống ghi nhận.
Mở rộng GB300 NVL72, Cải tiến phần mềm và Kết quả Đối tác
Trong cùng vòng, bản nộp DeepSeek-R1 của NVIDIA đã mở rộng từ một rack GB300 NVL72 duy nhất với 72 GPU lên bốn rack tổng cộng 288 GPU, đạt hiệu suất mở rộng 99% trong kịch bản offline, với thông lượng tăng gần tương ứng với phần cứng được thêm vào; công ty trích dẫn các mục 6.1-0073 và 6.1-0074. Trên bộ chuẩn WAN 2.2 text-to-video, GB300 NVL72 đạt 0,65 video 720p mỗi giây với thời gian 5,7 giây mỗi video, mà NVIDIA cho biết tương đương với thông lượng cao hơn 9 lần và độ trễ thấp hơn 7,5 lần so với một nút đơn.
NVIDIA báo cáo rằng hiệu năng GB300 NVL72 trên Qwen3-VL đã cải thiện tới 1,6 lần trong phiên bản v6.1 so với kết quả v6.0, nhờ độ chính xác KV cache thấp hơn, tích hợp kernel bổ sung, kernel tốt hơn và phục vụ tách rời với vLLM và NVIDIA Dynamo. Công ty cho biết việc tối ưu vẫn tiếp tục sau hạn chót nộp v6.1, và các kết quả sau nộp trên GPT-OSS-120B và DLRMv3 cho thấy những cải thiện thêm, mặc dù các số liệu này chưa được MLCommons xác nhận.
Ngoài các nền tảng quy mô rack, NVIDIA đã nộp kết quả Jetson AGX Thor sử dụng thư viện TensorRT Edge-LLM trên bộ chuẩn Edge-Agentic mới giới thiệu với mô hình Qwen3.6-27B. Công ty cho biết 19 đối tác đã tham gia vòng này, trong đó tám đối tác nộp trên hệ thống Blackwell NVL72 đa nút: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro và Wiwynn.
MLCommons ghi chú trên trang bộ chuẩn của mình rằng các kết quả đã công bố đôi khi được sửa đổi hoặc vô hiệu hoá sau khi công bố ban đầu, và mọi thay đổi sẽ được ghi lại trong nhật ký thay đổi của họ.












