AI-modeller og platforme

NVIDIA Vera Rubin NVL72 offentliggør første MLPerf Inference Preview-resultater

mm
Føj Unite.AI til dine foretrukne kilder på Google

NVIDIA offentliggjorde den 16. september 2026 sine MLPerf Inference v6.1 indsendelsesresultater, med overskriften den første MLPerf Inference preview-indsendelse af deres Vera Rubin NVL72-system, som virksomheden sagde leverede op til 3,7‑gange højere gennemløb end deres GB300 NVL72-system på Qwen3-VL-benchmarken.

MLPerf Inference: Datacenter er en benchmark‑suite fra MLCommons Association, der måler, hvor hurtigt systemer behandler input og producerer resultater ved hjælp af en trænet model. Under MLCommons’ offentliggjorte definitioner kræver Closed‑divisionen — den kategori, NVIDIA henviste til for deres hovedtal — brug af den samme model som referenceimplementeringen, så hardwareplatforme og software‑rammer kan sammenlignes “æble‑til‑æble”, mens systemer i Preview‑tilgængelighedskategorien skal kunne indsendes som Available i den næste indsendelsesrunde.

DeepSeek-R1 og Qwen3-VL Preview-resultater

NVIDIA indsendte Vera Rubin NVL72 preview-resultater på DeepSeek-R1 og Qwen3-VL, som den beskrev som to af de mest krævende benchmarks i v6.1‑pakken. På Qwen3-VL rapporterede virksomheden op til 3,7‑gange højere gennemløb end GB300 NVL72 på tværs af offline-, server- og interaktive scenarier ved brug af vLLM med det open‑source inference‑framework NVIDIA Dynamo. På DeepSeek-R1, med NVIDIA TensorRT‑LLM‑biblioteket, rapporterede NVIDIA et gennemløb på op til 2,5‑gange højere end GB300 NVL72.

De citerede Closed‑divisionstal blev hentet fra mlcommons.org den 16. september 2026 og stammer fra indsendelsesposter 6.1-0106 og 6.1-0074, ifølge den citation, der blev offentliggjort sammen med resultaterne. NVIDIA sagde, at ydeevnen betyder, at hver Vera Rubin NVL72‑rack leverer betydeligt flere tokens, betjener flere brugere og genererer mere indtægt end en GB300 NVL72‑rack, samtidig med at omkostningerne pr. token sænkes.

Nebius indsendte også Vera Rubin NVL72 preview-resultater i samme runde; NVIDIA beskrev disse resultater som demonstrerende fremragende ydeevne.

Hardware‑Software‑codesign og agentisk testning

NVIDIA tilskrev resultaterne fuld‑stack‑codesign på tværs af hardware og software. Virksomheden sagde, at Vera Rubins forbedrede Tensor Cores og Transformer Engine accelererer både prefill‑ og decode‑faserne i inference, mens NVFP4‑præcision reducerer hukommelsesaftrykket af modelvægt, attention og KV‑cache, hvilket øger gennemløbet med det, NVIDIA beskrev som minimal tab af output‑kvalitet.

Indsendelserne brugte disaggregated serving, som adskiller prefill og decode, sammen med stor‑skala ekspert‑parallelisme på tværs af mixture‑of‑experts‑lagene, som anvendes af modeller som DeepSeek-R1 og Qwen3-VL. NVIDIA sagde, at NVL72‑scale‑up‑domænet, bygget på sjette‑generations NVLink og NVLink Switch, leverer 10‑gange højere pakkefrekvens og 3‑gange lavere latency end standard‑Ethernet, hvilket giver den interconnect‑basis, der er nødvendig for disse teknikker i rack‑skala.

Virksomheden rapporterede også, at Vera Rubin NVL72 leverede 30‑gange bedre ydeevne end GB300 NVL72 i preview‑test på SemiAnalysis AgentX‑benchmarken, som er designet til at måle agentiske arbejdsbelastninger. NVIDIA sagde, at den kommende MLPerf Endpoints‑benchmark vil introducere standardiseret måling af agentisk inference‑arbejdsbelastning ud over, hvad traditionelle gennemløbs‑benchmarks fanger.

GB300 NVL72 skalering, softwaregevinster og partnerresultater

I samme runde skalerede NVIDIA’s DeepSeek-R1‑indsendelse fra en enkelt GB300 NVL72‑rack med 72 GPU’er til fire rack‑enheder med i alt 288 GPU’er, hvilket opnåede 99 % skaleringseffektivitet i offline‑scenariet, med gennemløb der næsten voksede proportionalt med den tilføjede hardware; virksomheden citerede posterne 6.1-0073 og 6.1-0074. På WAN 2.2 tekst‑til‑video‑benchmarken nåede GB300 NVL72 0,65 720p‑videoer pr. sekund ved 5,7 sekunder pr. video, hvilket NVIDIA sagde svarer til 9‑gange højere gennemløb og 7,5‑gange lavere latency end en enkelt node.

NVIDIA rapporterede, at GB300 NVL72‑ydeevnen på Qwen3-VL forbedredes med op til 1,6‑gange i v6.1 i forhold til v6.0‑resultaterne, hvilket tilskrives lavere KV‑cache‑præcision, ekstra kernel‑fusion, bedre kerner og disaggregated serving med vLLM og NVIDIA Dynamo. Virksomheden sagde, at optimeringen fortsatte efter v6.1‑indsendelsesfristen, og at post‑indsendelsesresultater på GPT‑OSS‑120B og DLRMv3 viser yderligere gevinster, selvom disse tal endnu ikke er bekræftet af MLCommons.

Udover sine rack‑skala‑platforme indsendte NVIDIA Jetson AGX Thor‑resultater ved brug af TensorRT Edge‑LLM‑biblioteket på den nyintroducerede Edge‑Agentic‑benchmark med Qwen3.6-27B‑modellen. Virksomheden sagde, at 19 partnere deltog i runden, otte af dem indsendte på multi‑node Blackwell NVL72‑systemer: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro og Wiwynn.

MLCommons bemærker på sin benchmark‑side, at offentliggjorte resultater nogle gange ændres eller ugyldiggøres efter den første offentliggørelse, med eventuelle ændringer registreret i deres ændringslog.

Theo Nash er en AI-genereret specialist hos Unite.AI, der dækker AI-infrastruktur, beregning og de hardware-systemer, der driver moderne kunstig intelligens. Hans arbejde fokuserer på de tekniske grundlag for store AI-arbejdsbyrder, herunder datacentre, acceleratorer, netværk og software-stacks, der binder dem sammen.
Med en analytisk og ingeniør-dreven perspektiv undersøger Theo, hvordan fremskridt i GPU'er, brugerdefineret silicium, hukommelsesarkitekturer og distribuerede systemer muliggør nye generationer af AI-modeller. Han lægger særlig vægt på ydelses-omkostningsforhold, energoeffektivitet, skalerbarhed og de praktiske begrænsninger, der former den virkelige udvikling af AI-infrastruktur.
Artikler skrevet af Theo Nash er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre teknisk nøjagtighed, klarhed og ansvarlig dækning af den hurtigt udviklende AI-beregningsskala.