Моделі та платформи ШІ
NVIDIA Vera Rubin NVL72 публікує перші результати попереднього тестування MLPerf Inference

NVIDIA 16 вересня 2026 р. опублікувала свої результати подання MLPerf Inference v6.1, заголовком яких стало перше попереднє подання MLPerf Inference системи Vera Rubin NVL72, яку, за словами компанії, забезпечила до 3,7‑раз вищу пропускну здатність порівняно з її системою GB300 NVL72 у бенчмарку Qwen3-VL.
MLPerf Inference: Datacenter — це набір бенчмарків асоціації MLCommons, який вимірює швидкість обробки системами вхідних даних та отримання результатів за допомогою навченої моделі. Згідно з опублікованими визначеннями MLCommons, розділ Closed — категорія, яку NVIDIA зазначила для своїх ключових показників — вимагає використання тієї ж моделі, що й референсна реалізація, щоб апаратні платформи та програмні фреймворки можна було порівнювати «яблуко до яблука», тоді як системи у категорії доступності Preview мають бути подані як Available у наступному раунді подання.
Попередні результати DeepSeek‑R1 та Qwen3‑VL
NVIDIA подала попередні результати Vera Rubin NVL72 за показниками DeepSeek‑R1 та Qwen3‑VL, які вона описала як два з найвимогливіших бенчмарків у наборі v6.1. У Qwen3‑VL компанія повідомила про до 3,7‑раз вищу пропускну здатність порівняно з GB300 NVL72 у офлайн, серверних та інтерактивних сценаріях, використовуючи vLLM разом з відкритим фреймворком інференції NVIDIA Dynamo. У DeepSeek‑R1, застосовуючи бібліотеку NVIDIA TensorRT‑LLM, NVIDIA повідомила про пропускну здатність до 2,5‑раз вищу, ніж у GB300 NVL72.
Наведені цифри розділу Closed були отримані з mlcommons.org 16 вересня 2026 р. і взяті з поданих записів 6.1‑0106 та 6.1‑0074, згідно з цитатою, опублікованою разом із результатами. NVIDIA зазначила, що така продуктивність означає, що кожна шафа Vera Rubin NVL72 забезпечує значно більше токенів, обслуговує більше користувачів і генерує більше доходу, ніж шафа GB300 NVL72, при цьому знижуючи вартість одного токена.
Nebius також подала попередні результати Vera Rubin NVL72 у тому ж раунді; NVIDIA охарактеризувала ці результати як демонстрацію відмінної продуктивності.
Ко‑дизайн апаратного та програмного забезпечення та агентне тестування
NVIDIA приписала результати повному стековому ко‑дизайну апаратного та програмного забезпечення. Компанія зазначила, що покращені Tensor Cores та Transformer Engine у Vera Rubin прискорюють як етап prefill, так і декодування під час інференції, тоді як точність NVFP4 зменшує обсяг пам’яті, зайнятої вагою моделі, увагою та кешем KV, підвищуючи пропускну здатність, що, за словами NVIDIA, супроводжується мінімальними втратами якості вихідних даних.
Подання використовували дезагреговане обслуговування, яке розділяє prefill і decode, разом із масштабною паралелізацією експертів у шарах mixture-of-experts, що застосовуються в моделях, таких як DeepSeek‑R1 та Qwen3‑VL. NVIDIA зазначила, що домен масштабування NVL72, побудований на шостому поколінні NVLink та NVLink Switch, забезпечує в 10‑раз вищу швидкість пакетів і в 3‑раз нижчу затримку порівняно зі стандартним Ethernet, створюючи інфраструктуру з’єднання для цих технологій у масштабі шафи.
Компанія також повідомила, що Vera Rubin NVL72 забезпечила в 30‑раз кращу продуктивність порівняно з GB300 NVL72 у попередньому тестуванні за бенчмарком SemiAnalysis AgentX, який розроблений для вимірювання агентних навантажень. NVIDIA зазначила, що майбутній бенчмарк MLPerf Endpoints внесе стандартизоване вимірювання агентних інференційних навантажень, що виходять за межі того, що охоплюють традиційні бенчмарки пропускної здатності.
Масштабування GB300 NVL72, покращення програмного забезпечення та результати партнерів
У тому ж раунді подання DeepSeek‑R1 від NVIDIA масштабувалося від однієї шафи GB300 NVL72 з 72 GPU до чотирьох шаф у сумі 288 GPU, досягнувши 99 % ефективності масштабування у офлайн‑сценарії, причому пропускна здатність майже пропорційно зростала зі збільшенням обладнання; компанія посилається на записи 6.1‑0073 та 6.1‑0074. У бенчмарку WAN 2.2 текст‑у‑відео GB300 NVL72 досягла 0,65 відео у форматі 720p за секунду при 5,7 секунди на відео, що, за словами NVIDIA, відповідає 9‑раз вищій пропускній здатності та 7,5‑раз нижчій затримці порівняно з одним вузлом.
NVIDIA повідомила, що продуктивність GB300 NVL72 у Qwen3‑VL покращилася до 1,6‑раз у v6.1 порівняно з результатами v6.0, завдяки нижчій точності кешу KV, додатковому злиттю ядер, кращим ядрам та дезагрегованому обслуговуванню за допомогою vLLM і NVIDIA Dynamo. Компанія зазначила, що оптимізація тривала після дедлайну подання v6.1, і що результати після подання для GPT‑OSS‑120B та DLRMv3 демонструють подальші покращення, хоча ці цифри ще не були підтверджені MLCommons.
Поза своїми платформами у масштабі шафи, NVIDIA подала результати Jetson AGX Thor, використовуючи бібліотеку TensorRT Edge‑LLM у новоствореному бенчмарку Edge‑Agentic з моделлю Qwen3.6‑27B. Компанія повідомила, що у раунді взяли участь 19 партнерів, вісім з яких подавали результати на багатовузлових системах Blackwell NVL72: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro та Wiwynn.
MLCommons зазначає на своїй сторінці бенчмарку, що опубліковані результати іноді змінюються або анулюються після первинної публікації, причому всі зміни фіксуються у журналі змін.












