AI-modeller och plattformar
NVIDIA Vera Rubin NVL72 publicerar första MLPerf Inference-förhandsresultaten

NVIDIA publicerade den 16 september 2026 sina MLPerf Inference v6.1 inlämningsresultat, med rubriken om den första MLPerf Inference-förhandsinlämningen av sitt Vera Rubin NVL72‑system, vilket företaget uppgav levererade upp till 3,7 × högre genomströmning än dess GB300 NVL72‑system på Qwen3-VL‑benchmarken.
MLPerf Inference: Datacenter är en benchmarksvit från MLCommons Association som mäter hur snabbt system bearbetar indata och producerar resultat med en tränad modell. Enligt MLCommons’ publicerade definitioner kräver Closed‑divisionen — den kategori som NVIDIA hänvisade till för sina huvudresultat — att samma modell som referensimplementeringen används så att hårdvaruplattformar och mjukvaruramverk kan jämföras “äpple‑mot‑äpple”, medan system i Preview‑tillgänglighetskategorin måste kunna lämnas in som Available i nästa inlämningsrunda.
DeepSeek-R1 och Qwen3-VL förhandsresultat
NVIDIA lämnade Vera Rubin NVL72‑förhandsresultat på DeepSeek-R1 och Qwen3-VL, vilka de beskrev som två av de mest krävande benchmarkarna i v6.1‑sviten. På Qwen3-VL rapporterade företaget upp till 3,7× högre genomströmning än GB300 NVL72 i offline‑, server‑ och interaktiva scenarier, med vLLM och det öppna källkods‑inference‑ramverket NVIDIA Dynamo. På DeepSeek-R1, med NVIDIA TensorRT‑LLM‑biblioteket, rapporterade NVIDIA en genomströmning upp till 2,5× högre än GB300 NVL72.
De citerade Closed‑division‑talen hämtades från mlcommons.org den 16 september 2026 och härrör från inlämningsposter 6.1‑0106 och 6.1‑0074, enligt den citering som publicerades med resultaten. NVIDIA sade att prestandan innebär att varje Vera Rubin NVL72‑rack levererar avsevärt fler token, betjänar fler användare och genererar mer intäkt än ett GB300 NVL72‑rack samtidigt som kostnaden per token minskar.
Nebius lämnade också Vera Rubin NVL72‑förhandsresultat i samma runda; NVIDIA beskrev dessa resultat som ett bevis på utmärkt prestanda.
Hårdvara‑Mjukvara‑kodesign och agentisk testning
NVIDIA tackade full‑stack‑kodesign över hårdvara och mjukvara för resultaten. Företaget sade att Vera Rubins förbättrade Tensor Cores och Transformer Engine påskyndar både förfyllnings‑ och avkodningsstadierna i inferens, medan NVFP4‑precision minskar minnesavtrycket för modellvikter, attention och KV‑cache, vilket ökar genomströmningen med vad NVIDIA beskrev som minimal förlust av utdatakvalitet.
Inlämningarna använde disaggregated serving, som separerar förfyllning och avkodning, tillsammans med storskalig expert‑parallellism över mixture‑of‑experts‑lagren som används av modeller som DeepSeek‑R1 och Qwen3‑VL. NVIDIA sade att NVL72‑skalningsdomänen, byggd på sjätte generationens NVLink och NVLink Switch, levererar 10× högre paketfrekvens och 3× lägre latens än standard‑Ethernet, vilket ger den interconnect‑grund som behövs för dessa tekniker på rack‑nivå.
Företaget rapporterade också att Vera Rubin NVL72 levererade 30× bättre prestanda än GB300 NVL72 i förhandsprovning på SemiAnalysis AgentX‑benchmarken, som är avsedd att mäta agentiska arbetsbelastningar. NVIDIA sade att den kommande MLPerf Endpoints‑benchmarken kommer att införa standardiserad mätning av agentisk inferens‑arbetsbelastning bortom vad traditionella genomströmnings‑benchmarkar fångar.
GB300 NVL72‑skalning, mjukvarufördelar och partnerresultat
I samma runda skalerade NVIDIAs DeepSeek‑R1‑inlämning från ett enda GB300 NVL72‑rack med 72 GPU:er till fyra rack med totalt 288 GPU:er, och uppnådde 99 % skalningseffektivitet i offline‑scenariot, med genomströmning som nästan ökade proportionellt mot den tillagda hårdvaran; företaget hänvisade till posterna 6.1‑0073 och 6.1‑0074. På WAN 2.2 text‑till‑video‑benchmarken nådde GB300 NVL72 0,65 720p‑videor per sekund med 5,7 sekunder per video, vilket NVIDIA sade motsvarar 9 × högre genomströmning och 7,5 × lägre latens än en enskild nod.
NVIDIA rapporterade att GB300 NVL72‑prestanda på Qwen3‑VL förbättrades med upp till 1,6× i v6.1 jämfört med dess v6.0‑resultat, och tillskrev detta lägre KV‑cache‑precision, ytterligare kernel‑fusion, bättre kernels och disaggregated serving med vLLM och NVIDIA Dynamo. Företaget sade att optimeringen fortsatte efter v6.1‑inlämningsdeadline, och att efterinlämningsresultat på GPT‑OSS‑120B och DLRMv3 visar ytterligare vinster, även om dessa siffror ännu inte har verifierats av MLCommons.
Utöver sina rack‑skalaplattaformer lämnade NVIDIA Jetson AGX Thor‑resultat med TensorRT Edge‑LLM‑biblioteket på den nyintroducerade Edge‑Agentic‑benchmarken med Qwen3.6‑27B‑modellen. Företaget sade att 19 partner deltog i rundan, åtta av dem lämnade in på multi‑node Blackwell NVL72‑system: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro och Wiwynn.
MLCommons noterar på sin benchmark‑sida att publicerade resultat ibland ändras eller ogiltigförklaras efter den första publiceringen, och att eventuella ändringar registreras i dess förändringslogg.












