Modely a platformy AI
NVIDIA Vera Rubin NVL72 zveřejňuje první výsledky náhledu MLPerf Inference

NVIDIA 16. září 2026 zveřejnila své výsledky podání MLPerf Inference v6.1, přičemž hlavní zprávou je první náhledové podání MLPerf Inference svého systému Vera Rubin NVL72, o němž společnost uvedla, že dosahuje až 3,7‑násobně vyšší propustnosti než její systém GB300 NVL72 v benchmarku Qwen3-VL.
MLPerf Inference: Datacenter je benchmarková sada asociace MLCommons, která měří, jak rychle systémy zpracovávají vstupy a generují výsledky pomocí natrénovaného modelu. Podle publikovaných definic MLCommons vyžaduje uzavřená (Closed) divize — kategorie, kterou NVIDIA uvádí pro své hlavní údaje — použití stejného modelu jako referenční implementace, aby bylo možné srovnávat hardwarové platformy a softwarové rámce „jablko s jablkem“, zatímco systémy v kategorii Preview musí být v dalším kole podání připraveny jako dostupné.
Výsledky náhledu DeepSeek-R1 a Qwen3-VL
NVIDIA předložila náhledové výsledky Vera Rubin NVL72 na benchmarkech DeepSeek-R1 a Qwen3-VL, které popisuje jako dva z nejnáročnějších benchmarků v sadě v6.1. V případě Qwen3-VL společnost uvedla až 3,7‑násobně vyšší propustnost než GB300 NVL72 ve scénářích offline, server a interaktivní, přičemž použila vLLM s open source inference frameworkem NVIDIA Dynamo. U DeepSeek-R1, s využitím knihovny NVIDIA TensorRT-LLM, NVIDIA oznámila propustnost až 2,5‑násobně vyšší než GB300 NVL72.
Uvedené údaje z uzavřené divize byly získány z mlcommons.org dne 16. září 2026 a pocházejí ze vstupních záznamů 6.1-0106 a 6.1-0074, podle citace zveřejněné spolu s výsledky. NVIDIA uvedla, že výkon znamená, že každý rack Vera Rubin NVL72 poskytuje výrazně více tokenů, obsluhuje více uživatelů a generuje vyšší příjmy než rack GB300 NVL72, přičemž snižuje náklady na token.
Nebius také předložil náhledové výsledky Vera Rubin NVL72 ve stejném kole; NVIDIA tyto výsledky popisuje jako ukazující vynikající výkon.
Hardwarově‑softwarový kódový design a agentické testování
NVIDIA připisuje výsledky kompletnímu kódovému designu napříč hardwarem a softwarem. Společnost uvedla, že vylepšené Tensor Cores a Transformer Engine systému Vera Rubin urychlují jak fázi předvyplnění (prefill), tak dekódování při inference, zatímco přesnost NVFP4 snižuje paměťovou stopu modelových vah, attention a KV cache, což zvyšuje propustnost s tím, co NVIDIA popisuje jako minimální ztrátu kvality výstupu.
Podání využívala disaggregované poskytování, které odděluje fáze předvyplnění a dekódování, spolu s rozsáhlým paralelismem expertů napříč vrstvami mixture-of-experts používanými modely jako DeepSeek-R1 a Qwen3-VL. NVIDIA uvedla, že doména škálování NVL72, postavená na šesté generaci NVLink a NVLink Switch, poskytuje 10‑násobně vyšší rychlost paketů a 3‑násobně nižší latenci než standardní Ethernet, čímž zajišťuje základ pro tyto techniky na úrovni racku.
Společnost také uvedla, že Vera Rubin NVL72 dosáhla v náhledovém testování na benchmarku SemiAnalysis AgentX až 30‑násobně lepšího výkonu než GB300 NVL72, který je určen k měření agentických zátěží. NVIDIA uvedla, že nadcházející benchmark MLPerf Endpoints přinese standardizované měření agentických inference úloh, které přesahuje to, co zachycují tradiční benchmarky propustnosti.
Škálování GB300 NVL72, softwarové zisky a výsledky partnerů
Ve stejném kole se podání DeepSeek-R1 od NVIDIA rozšířilo z jednoho racku GB300 NVL72 s 72 GPU na čtyři racky celkem 288 GPU, přičemž dosáhlo 99 % efektivity škálování v offline scénáři a propustnost rostla téměř úměrně přidanému hardwaru; společnost citovala záznamy 6.1-0073 a 6.1-0074. V benchmarku WAN 2.2 text‑to‑video dosáhl GB300 NVL72 výkonu 0,65 videí 720p za sekundu při 5,7 s na video, což NVIDIA uvádí jako 9‑násobně vyšší propustnost a 7,5‑násobně nižší latenci než u jednoho uzlu.
NVIDIA uvedla, že výkon GB300 NVL72 na Qwen3-VL se v verzi v6.1 oproti výsledkům v6.0 zlepšil až 1,6‑násobně, přičemž přičítá nižší přesnost KV cache, další fúzi kernelů, lepší kernely a disaggregované poskytování s vLLM a NVIDIA Dynamo. Společnost uvedla, že optimalizace pokračovala i po termínu podání v6.1 a že výsledky po podání na GPT‑OSS‑120B a DLRMv3 ukazují další zisky, ačkoliv tyto údaje zatím nebyly ověřeny organizací MLCommons.
Mimo své rack‑scale platformy NVIDIA předložila výsledky Jetson AGX Thor s využitím knihovny TensorRT Edge‑LLM v nově zavedeném benchmarku Edge‑Agentic s modelem Qwen3.6‑27B. Společnost uvedla, že v kole se zúčastnilo 19 partnerů, osm z nich podalo výsledky na víceuzlových systémech Blackwell NVL72: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro a Wiwynn.
MLCommons uvádí na své stránce benchmarku, že zveřejněné výsledky jsou někdy po první publikaci upraveny nebo zneplatněny, přičemž veškeré změny jsou zaznamenány v jeho změnovém protokolu.












