AI-modeller og plattformer

NVIDIA Vera Rubin NVL72 publiserer første MLPerf Inference‑forhåndsvisningsresultater

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

NVIDIA publiserte den 16. september 2026 sine MLPerf Inference v6.1 innsendingsresultater, med overskriften den første MLPerf Inference‑forhåndsvisningsinnsendelsen av sitt Vera Rubin NVL72‑system, som selskapet sa leverte opptil 3,7‑ganger høyere gjennomstrømning enn sitt GB300 NVL72‑system på Qwen3‑VL‑benchmarken.

MLPerf Inference: Datacenter er en benchmark‑pakke fra MLCommons Association som måler hvor raskt systemer behandler innganger og produserer resultater ved hjelp av en trent modell. I henhold til MLCommons’ publiserte definisjoner, krever Closed‑divisjonen — den kategorien NVIDIA refererte til for sine overskriftsfigurer — at samme modell som referanseimplementasjonen brukes, slik at maskinvareplattformer og programvarerammeverk kan sammenlignes «eple‑for‑eple», mens systemer i Preview‑tilgjengelighetskategorien må kunne leveres som Available i neste innsendelsesrunde.

DeepSeek‑R1‑ og Qwen3‑VL‑forhåndsvisningsresultater

NVIDIA leverte Vera Rubin NVL72‑forhåndsvisningsresultater på DeepSeek‑R1 og Qwen3‑VL, som selskapet beskrev som to av de mest krevende benchmarkene i v6.1‑pakken. På Qwen3‑VL rapporterte selskapet opptil 3,7‑ganger høyere gjennomstrømning enn GB300 NVL72 i offline‑, server‑ og interaktive‑scenarioene, ved bruk av vLLM med NVIDIA Dynamo‑rammeverket for åpen kildekode‑inference. På DeepSeek‑R1, med NVIDIA TensorRT‑LLM‑biblioteket, rapporterte NVIDIA en gjennomstrømning på opptil 2,5‑ganger høyere enn GB300 NVL72.

De siterte Closed‑divisjons­tallene ble hentet fra mlcommons.org den 16. september 2026, og er hentet fra innsendelsesoppføringer 6.1‑0106 og 6.1‑0074, i henhold til referansen publisert sammen med resultatene. NVIDIA sa at ytelsen betyr at hver Vera Rubin NVL72‑rack leverer betydelig flere token, betjener flere brukere og genererer mer inntekt enn en GB300 NVL72‑rack, samtidig som kostnaden per token reduseres.

Nebius leverte også Vera Rubin NVL72‑forhåndsvisningsresultater i samme runde; NVIDIA beskrev disse resultatene som demonstrerende fremragende ytelse.

Maskinvare‑Programvare‑kodesign og Agentisk testing

NVIDIA tilskrev full‑stack‑kodesign på tvers av maskinvare og programvare for resultatene. Selskapet sa at Vera Rubins forbedrede Tensor Cores og Transformer Engine akselererer både prefill‑ og decode‑stadiene i inferens, mens NVFP4‑presisjon reduserer minneavtrykket til modellvekter, oppmerksomhet og KV‑cache, og øker gjennomstrømningen med det NVIDIA beskrev som minimal tap av utdata‑kvalitet.

Innsendelsene brukte disaggregert serving, som skiller prefill og decode, sammen med storskala ekspert‑parallellisme på tvers av mixture‑of‑experts‑lagene som brukes av modeller som DeepSeek‑R1 og Qwen3‑VL. NVIDIA sa at NVL72‑skalerings‑domene, bygget på sjette‑generasjons NVLink og NVLink Switch, leverer 10‑ganger høyere pakkefrekvens og 3‑ganger lavere latens enn standard Ethernet, og gir interconnect‑grunnlaget for disse teknikkene på rack‑nivå.

Selskapet rapporterte også at Vera Rubin NVL72 leverte 30‑ganger bedre ytelse enn GB300 NVL72 i forhåndsvisningstesting på SemiAnalysis AgentX‑benchmarken, som er designet for å måle agentiske arbeidsbelastninger. NVIDIA sa at den kommende MLPerf Endpoints‑benchmarken vil innføre standardisert måling av agentisk inferens‑arbeidsbelastning utover det tradisjonelle gjennomstrømnings‑benchmarkene fanger.

GB300 NVL72‑skalering, programvaregevinster og partnerresultater

I samme runde skalerte NVIDIA‑s DeepSeek‑R1‑innsending fra en enkelt GB300 NVL72‑rack med 72 GPU‑er til fire rack‑er med totalt 288 GPU‑er, og oppnådde 99 % skalerings‑effektivitet i offline‑scenarioet, med gjennomstrømning som vokste nesten proporsjonalt med den ekstra maskinvaren; selskapet siterte oppføringene 6.1‑0073 og 6.1‑0074. På WAN 2.2 tekst‑til‑video‑benchmarken nådde GB300 NVL72 0,65 720p‑videoer per sekund med 5,7 sekunder per video, noe NVIDIA sa representerer 9‑ganger høyere gjennomstrømning og 7,5‑ganger lavere latens enn en enkelt node.

NVIDIA rapporterte at GB300 NVL72‑ytelsen på Qwen3‑VL forbedret seg med opptil 1,6‑ganger i v6.1 sammenlignet med v6.0‑resultatene, og tilskrev lavere KV‑cache‑presisjon, ekstra kernel‑fusing, bedre kjerner og disaggregert serving med vLLM og NVIDIA Dynamo. Selskapet sa at optimaliseringen fortsatte etter v6.1‑innsendelsesfristen, og at resultater etter innsendelse på GPT‑OSS‑120B og DLRMv3 viser ytterligere gevinster, selv om disse tallene ennå ikke er verifisert av MLCommons.

Utover sine rack‑skala plattformer leverte NVIDIA Jetson AGX Thor‑resultater ved bruk av TensorRT Edge‑LLM‑biblioteket på den nyinnførte Edge‑Agentic‑benchmarken med Qwen3.6‑27B‑modellen. Selskapet sa at 19 partnere deltok i runden, åtte av dem leverte på multi‑node Blackwell NVL72‑systemer: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro og Wiwynn.

MLCommons bemerker på sin benchmark‑side at publiserte resultater noen ganger blir endret eller ugyldiggjort etter første publisering, med eventuelle endringer registrert i endringsloggen.

Theo Nash er en AI-generert spesialist hos Unite.AI, som dekker AI-infrastruktur, beregning og hårdwaresystemer som driver moderne kunstig intelligens. Hans arbeid fokuserer på de tekniske grunnlagene bak store AI-arbeidsbyrder, inkludert datacenter, akseleratorer, nettverk og programvarestackene som binder dem sammen.
Med en analytisk og ingeniør-drevet perspektiv, undersøker Theo hvordan fremgangen i GPUs, tilpasset silisium, minnearkitekturer og distribuerte systemer muliggjør nye generasjoner av AI-modeller. Han legger spesiell vekt på ytelses-avveininger, energieffektivitet, skalerbarhet og de praktiske begrensningene som former virkelige AI-infrastruktur-utsteder.
Artikler skrevet av Theo Nash er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre teknisk nøyaktighet, klarhet og ansvarlig dekning av den raskt utviklende AI-beregningssfæren.