AI-mallit ja alustat
NVIDIA Vera Rubin NVL72 julkaisee ensimmäiset MLPerf Inference -esikatselutulokset

NVIDIA julkaisi 16. syyskuuta 2026 MLPerf Inference v6.1 -lähetystulokset, joihin sisältyi sen Vera Rubin NVL72 -järjestelmän ensimmäinen MLPerf Inference -esikatselulähetys, jonka yhtiön mukaan se tuotti jopa 3,7‑kerran suuremman läpiviennin kuin sen GB300 NVL72 -järjestelmä Qwen3-VL -vertailussa.
MLPerf Inference: Datacenter on MLCommons Association -yhteisön benchmark-sarja, joka mittaa, kuinka nopeasti järjestelmät käsittelevät syötteitä ja tuottavat tuloksia koulutetun mallin avulla. MLCommonsin julkaistut määritelmät mukaisesti Closed‑luokka — kategoria, jonka NVIDIA mainitsi otsikkoluvuissaan — edellyttää saman mallin käyttöä referenssitoimituksen kanssa, jotta laitteistoplatformit ja ohjelmistokehykset voidaan vertailla \”omena-omenalle\”, kun taas Preview‑saatavuusluokan järjestelmien on oltava toimitettavissa seuraavassa lähetyskierroksessa saatavilla.
DeepSeek-R1- ja Qwen3-VL‑esikatselutulokset
NVIDIA lähetti Vera Rubin NVL72 -esikatselutulokset DeepSeek-R1:ssä ja Qwen3-VL:ssä, joita se kuvasi kahdeksi vaativimmaksi benchmarkiksi v6.1‑sarjassa. Qwen3-VL:ssä yhtiö raportoi jopa 3,7‑kerran suuremman läpiviennin kuin GB300 NVL72 offline-, server- ja interaktiivisissa skenaarioissa käyttäen vLLM:ää NVIDIA Dynamo -avointen lähdekoodien inferenssikehyksen kanssa. DeepSeek-R1:ssä, käyttäen NVIDIA TensorRT-LLM -kirjastoa, NVIDIA raportoi läpiviennin jopa 2,5‑kerran korkeampana kuin GB300 NVL72.
Mainitut Closed‑luokan luvut haettiin mlcommons.org-sivustolta 16. syyskuuta 2026, ja ne perustuvat lähetyskirjauksiin 6.1-0106 ja 6.1-0074, kuten tulosten yhteydessä julkaistussa viitteessä todetaan. NVIDIA totesi, että suorituskyky tarkoittaa, että jokainen Vera Rubin NVL72 -rack tuottaa merkittävästi enemmän tokeneita, palvelee enemmän käyttäjiä ja tuottaa enemmän tuloja kuin GB300 NVL72 -rack samalla kun tokenin kustannus alenee.
Nebius lähetti myös Vera Rubin NVL72 -esikatselutulokset samassa kierroksessa; NVIDIA kuvasi nämä tulokset osoittavan erinomaista suorituskykyä.
Laitteisto‑ohjelmisto‑yhteissuunnittelu ja agenttinen testaus
NVIDIA kiitti tuloksia täyden pinon yhteissuunnittelusta laitteiston ja ohjelmiston välillä. Yhtiön mukaan Vera Rubinin parannetut Tensor‑ytimet ja Transformer‑Engine nopeuttavat sekä prefill‑ että decode‑vaiheita inferenssissä, kun taas NVFP4‑tarkkuus vähentää mallipainojen, huomion ja KV‑välimuistin muistijalanjälkeä, mikä nostaa läpiviivyyttä niin kuin NVIDIA kuvasi, että tuloksen laadun menetys on minimaalinen.
Lähetykset käyttivät hajautettua palvelua, joka erottaa prefill‑ ja decode‑vaiheet, yhdessä laajamittaisen asiantuntijaparantelisuuden kanssa sekoitus‑asiantuntija‑kerroksissa, joita käyttävät mallit kuten DeepSeek-R1 ja Qwen3-VL. NVIDIA totesi, että NVL72‑skaalausalue, joka on rakennettu kuudennen sukupolven NVLinkiin ja NVLink‑Switchiin, tarjoaa 10‑kertaisesti suuremmat pakettinopeudet ja 3‑kertaisesti pienemmän viiveen kuin tavallinen Ethernet, tarjoten yhteysinfrastruktuurin näille tekniikoille rack‑tasolla.
Yhtiö raportoi myös, että Vera Rubin NVL72 saavutti 30‑kertaisesti paremman suorituskyvyn kuin GB300 NVL72 esikatselutestauksessa SemiAnalysis AgentX -benchmarkissa, joka on suunniteltu mittaamaan agenttisia työkuormia. NVIDIA totesi, että tuleva MLPerf Endpoints -benchmark tuo standardoidun mittauksen agenttisille inferenssityökuormille perinteisten läpiviennitestien ulkopuolelle.
GB300 NVL72 -skaalaus, ohjelmistohyödyt ja kumppanitulokset
Samassa kierroksessa NVIDIA:n DeepSeek-R1 -lähetys skaalautui yhdestä 72 GPU:n GB300 NVL72 -rackista neljään rackiin yhteensä 288 GPU:ta, saavuttaen 99 % skaalaustehokkuuden offline‑skenaariossa, jolloin läpivienti kasvoi lähes suhteessa lisättyyn laitteistoon; yhtiö viittasi kirjauksiin 6.1-0073 ja 6.1-0074. WAN 2.2 -teksti‑video -benchmarkissa GB300 NVL72 saavutti 0,65 720p‑videota sekunnissa 5,7 sekuntia per video, mikä NVIDIA:n mukaan tarkoittaa 9‑kertainen läpivienti ja 7,5‑kertainen alhaisempi viive kuin yhdellä solmulla.
NVIDIA raportoi, että GB300 NVL72 -suorituskyky Qwen3-VL:ssä parani jopa 1,6‑kertaiseksi v6.1:ssä verrattuna v6.0‑tuloksiin, kiittäen alhaisempaa KV‑välimuistin tarkkuutta, lisättyä kernel‑yhdistämistä, parempia kernelleja ja hajautettua palvelua vLLM:n ja NVIDIA Dynamo:n kanssa. Yhtiö totesi, että optimointi jatkui v6.1‑lähetyksen määräajan jälkeen, ja että post‑lähetystulokset GPT-OSS-120B:ssä ja DLRMv3:ssa osoittavat lisäparannuksia, vaikka MLCommons ei ole vielä vahvistanut näitä lukuja.
Rack‑tasolla olevien alustoiden lisäksi NVIDIA lähetti Jetson AGX Thor -tulokset käyttäen TensorRT Edge-LLM -kirjastoa uudessa Edge-Agentic -benchmarkissa Qwen3.6-27B -mallilla. Yhtiö kertoi, että 19 kumppania osallistui kierrokseen, kahdeksan heistä lähetti tulokset monisolmuisten Blackwell NVL72 -järjestelmien kautta: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro ja Wiwynn.
MLCommons huomauttaa benchmark‑sivullaan, että julkaistuja tuloksia joskus muokataan tai mitätöidään alkuperäisen julkaisun jälkeen, ja kaikki muutokset kirjataan sen muutoslokiin.












