AI 模型与平台
NVIDIA Vera Rubin NVL72 发布首个 MLPerf 推理预览结果

NVIDIA 于 2026 年 9 月 16 日发布了其 MLPerf Inference v6.1 提交结果,标题为其 Vera Rubin NVL72 系统的首个 MLPerf 推理预览提交,公司表示在 Qwen3-VL 基准测试中,其吞吐量最高比 GB300 NVL72 系统提升了 3.7 倍。
MLPerf Inference:Datacenter 是由 MLCommons 协会提供的基准套件,用于衡量系统使用已训练模型处理输入并产生结果的速度。根据 MLCommons 发布的定义,Closed(封闭)分部——NVIDIA 用于其头条数据的类别——要求使用与参考实现相同的模型,以便硬件平台和软件框架能够实现“苹果对苹果”的比较,而 Preview(预览)可用性类别的系统必须能够在下一轮提交中以 Available(可用)状态提交。
DeepSeek-R1 与 Qwen3-VL 预览结果
NVIDIA 在 DeepSeek-R1 和 Qwen3-VL 上提交了 Vera Rubin NVL72 的预览结果,称其为 v6.1 套件中最具挑战性的两个基准。在 Qwen3-VL 上,公司报告称在离线、服务器和交互场景中,其吞吐量最高比 GB300 NVL72 提升了 3.7 倍,使用了配合 NVIDIA Dynamo 开源推理框架的 vLLM。 在 DeepSeek-R1 上,使用 NVIDIA TensorRT-LLM 库,NVIDIA 报告的吞吐量最高比 GB300 NVL72 提升了 2.5 倍。
引用的 Closed(封闭)分部数据于 2026 年 9 月 16 日从 mlcommons.org 获取,并依据随结果发布的引用,取自提交条目 6.1-0106 和 6.1-0074。NVIDIA 表示,这一性能意味着每个 Vera Rubin NVL72 机架能够交付显著更多的 token,服务更多用户,并产生比 GB300 NVL72 机架更高的收入,同时降低每个 token 的成本。
Nebius 也在同一轮提交了 Vera Rubin NVL72 的预览结果;NVIDIA 将这些结果描述为展现出卓越性能。
硬件‑软件协同设计与自主测试
NVIDIA 将这些成果归功于硬件和软件全栈协同设计。公司表示,Vera Rubin 的增强型 Tensor Cores 和 Transformer Engine 加速了推理的预填充和解码阶段,而 NVFP4 精度降低了模型权重、注意力和 KV 缓存的内存占用,提升了吞吐量,且 NVIDIA 称其对输出质量的损失极小。
这些提交采用了拆分服务(disaggregated serving),将预填充和解码分离,并在 DeepSeek-R1 和 Qwen3-VL 等模型使用的混合专家层上实现大规模专家并行。NVIDIA 表示,基于第六代 NVLink 和 NVLink Switch 构建的 NVL72 扩展域,其数据包速率比普通以太网高出 10 倍,延迟降低 3 倍,为机架级别的这些技术提供了互连基础。
公司还报告称,在用于衡量自主工作负载的 SemiAnalysis AgentX 基准的预览测试中,Vera Rubin NVL72 的性能比 GB300 NVL72 提升了 30 倍。NVIDIA 表示,即将推出的 MLPerf Endpoints 基准将为自主推理工作负载提供标准化测量,超越传统吞吐量基准的覆盖范围。
GB300 NVL72 扩展、软件提升与合作伙伴成果
在同一轮中,NVIDIA 的 DeepSeek-R1 提交从单个包含 72 块 GPU 的 GB300 NVL72 机架扩展至四个机架,共计 288 块 GPU,在离线场景下实现了 99% 的扩展效率,吞吐量几乎与新增硬件成比例增长;公司引用了条目 6.1-0073 和 6.1-0074。 在 WAN 2.2 文本转视频基准测试中,GB300 NVL72 达到每秒 0.65 个 720p 视频,单视频耗时 5.7 秒,NVIDIA 表示这相当于比单节点的吞吐量提升了 9 倍,延迟降低了 7.5 倍。
NVIDIA 报告称,GB300 NVL72 在 Qwen3-VL 上的性能在 v6.1 相较于 v6.0 提升了最高 1.6 倍,归功于更低的 KV 缓存精度、额外的内核融合、更优的内核以及使用 vLLM 和 NVIDIA Dynamo 的拆分服务。公司表示,优化工作在 v6.1 提交截止日期之后仍在进行,且在 GPT-OSS-120B 和 DLRMv3 上的提交后结果显示进一步提升,尽管这些数据尚未得到 MLCommons 的验证。
除了机架级平台外,NVIDIA 还使用 TensorRT Edge-LLM 库在新推出的 Edge-Agentic 基准上,搭配 Qwen3.6-27B 模型提交了 Jetson AGX Thor 的结果。公司表示,本轮有 19 家合作伙伴参与,其中八家在多节点 Blackwell NVL72 系统上提交:ASUS、Azure、Cisco、CoreWeave、Crusoe、Dell Technologies、Fujitsu、Giga Computing、HPE、Inventec、Lambda、MiTAC Computing、Nebius、Oracle Cloud Infrastructure、Quanta Cloud Technology、Red Hat、ScitiX、Supermicro 和 Wiwynn。
MLCommons 在其基准页面上指出,已发布的结果有时会在首次发布后被修改或作废,所有更改都会记录在其变更日志中。












