Модели и платформы ИИ
NVIDIA Vera Rubin NVL72 публикует первые результаты предварительного теста MLPerf Inference

NVIDIA 16 сентября 2026 года опубликовала свои результаты подачи MLPerf Inference v6.1, возглавляемые первым предварительным представлением MLPerf Inference её системы Vera Rubin NVL72, которую компания заявила, что обеспечивает до 3,7 раз более высокую пропускную способность по сравнению с её системой GB300 NVL72 в бенчмарке Qwen3-VL.
MLPerf Inference: Datacenter — это набор бенчмарков Ассоциации MLCommons, измеряющий скорость обработки системами входных данных и получения результатов с использованием обученной модели. Согласно опубликованным определениям MLCommons, закрытый (Closed) дивизион — категория, которую NVIDIA указала для своих основных цифр — требует использования той же модели, что и в эталонной реализации, чтобы аппаратные платформы и программные фреймворки можно было сравнивать “apples-to-apples”, тогда как системы в категории доступности Preview должны быть поданы как Available в следующем раунде подачи.
Результаты предварительного теста DeepSeek-R1 и Qwen3-VL
NVIDIA представила предварительные результаты Vera Rubin NVL72 по DeepSeek-R1 и Qwen3-VL, назвав их двумя из самых требовательных бенчмарков в наборе v6.1. По Qwen3-VL компания сообщила о до 3,7 раз более высокой пропускной способности по сравнению с GB300 NVL72 во всех сценариях — офлайн, серверный и интерактивный, используя vLLM совместно с открытым фреймворком инференса NVIDIA Dynamo. По DeepSeek-R1, используя библиотеку NVIDIA TensorRT-LLM, NVIDIA зафиксировала пропускную способность до 2,5 раз выше, чем у GB300 NVL72.
Указанные цифры закрытого дивизиона были получены с сайта mlcommons.org 16 сентября 2026 года и взяты из записей подачи 6.1-0106 и 6.1-0074, согласно ссылке, опубликованной вместе с результатами. NVIDIA заявила, что такая производительность означает, что каждая стойка Vera Rubin NVL72 поставляет значительно больше токенов, обслуживает больше пользователей и генерирует больший доход, чем стойка GB300 NVL72, одновременно снижая стоимость одного токена.
Nebius также представила предварительные результаты Vera Rubin NVL72 в том же раунде; NVIDIA охарактеризовала эти результаты как демонстрирующие отличную производительность.
Коддизайн аппаратного и программного обеспечения и агентное тестирование
NVIDIA отдала заслугу полностековому коддизайну аппаратного и программного обеспечения за эти результаты. Компания заявила, что улучшенные Tensor Cores и Transformer Engine системы Vera Rubin ускоряют как этап предварительного заполнения (prefill), так и декодирования при инференсе, тогда как точность NVFP4 уменьшает объём памяти, занимаемый весами модели, механизмом внимания и KV‑кэшем, повышая пропускную способность с тем, что NVIDIA описала как минимальная потеря качества вывода.
В подачах использовалось раздельное обслуживание (disaggregated serving), которое отделяет этапы prefill и decode, совместно с масштабным экспертным параллелизмом по слоям mixture-of-experts, применяемым в моделях, таких как DeepSeek-R1 и Qwen3-VL. NVIDIA заявила, что масштабируемый домен NVL72, построенный на шестом поколении NVLink и NVLink Switch, обеспечивает в 10 раз более высокие скорости передачи пакетов и в 3 раза более низкую задержку по сравнению со стандартным Ethernet, предоставляя основу межсоединения для этих техник на уровне стойки.
Компания также сообщила, что Vera Rubin NVL72 показала в 30 раз лучшую производительность по сравнению с GB300 NVL72 в предварительном тестировании на бенчмарке SemiAnalysis AgentX, предназначенном для измерения агентных нагрузок. NVIDIA заявила, что предстоящий бенчмарк MLPerf Endpoints введёт стандартизированное измерение агентных инференс‑нагрузок, выходя за рамки того, что фиксируют традиционные бенчмарки пропускной способности.
Масштабирование GB300 NVL72, программные улучшения и результаты партнёров
В том же раунде подача NVIDIA по DeepSeek‑R1 масштабировалась от одной стойки GB300 NVL72 с 72 GPU до четырёх стоек, суммарно 288 GPU, достигнув 99 % эффективности масштабирования в офлайн‑сценарии, при этом пропускная способность почти пропорционально росла с добавлением аппаратуры; компания указала записи 6.1-0073 и 6.1-0074. По бенчмарку WAN 2.2 text-to-video GB300 NVL72 достигла 0,65 720p‑видео в секунду при 5,7 секундах на видео, что, по словам NVIDIA, соответствует в 9 раз более высокой пропускной способности и в 7,5 раз более низкой задержке по сравнению с отдельным узлом.
NVIDIA сообщила, что производительность GB300 NVL72 по Qwen3‑VL улучшилась в v6.1 до 1,6 раз по сравнению с результатами v6.0, отдав заслугу более низкой точности KV‑кэша, дополнительному объединению ядер, лучшим ядрам и раздельному обслуживанию с vLLM и NVIDIA Dynamo. Компания заявила, что оптимизация продолжалась после срока подачи v6.1, и что пост‑подачные результаты по GPT‑OSS‑120B и DLRMv3 показывают дальнейший рост, хотя эти цифры ещё не проверены MLCommons.
Помимо своих платформ масштабом в стойку, NVIDIA представила результаты Jetson AGX Thor, использующие библиотеку TensorRT Edge‑LLM, на недавно введённом бенчмарке Edge‑Agentic с моделью Qwen3.6‑27B. Компания заявила, что в раунде участвовали 19 партнёров, восемь из которых представили результаты на многокомпонентных системах Blackwell NVL72: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro и Wiwynn.
MLCommons отмечает на странице своего бенчмарка, что опубликованные результаты иногда изменяются или аннулируются после первоначального опубликования, при этом все изменения фиксируются в журнале изменений.












