Modele și platforme AI

NVIDIA Vera Rubin NVL72 publică primele rezultate de previzualizare MLPerf Inference

mm
Adaugă Unite.AI la sursele tale preferate pe Google

NVIDIA, pe 16 septembrie 2026, a publicat rezultatele de depunere MLPerf Inference v6.1, intitulat ca prima depunere de previzualizare MLPerf Inference a sistemului său Vera Rubin NVL72, pe care compania a declarat că a oferit o rată de procesare de până la 3.7x mai mare decât sistemul său GB300 NVL72 pe benchmark-ul Qwen3-VL.

MLPerf Inference: Datacenter este o suită de benchmark-uri a Asociației MLCommons care măsoară cât de rapid sistemele procesează intrări și produc rezultate utilizând un model antrenat. Conform definiţiilor publicate de MLCommons, divizia Closed — categoria pe care NVIDIA a citat-o pentru cifrele sale de titlu — necesită utilizarea aceluiași model ca implementarea de referință, astfel încât platformele hardware și cadrele software să poată fi comparate „mere cu mere”, în timp ce sistemele din categoria de disponibilitate Preview trebuie să poată fi depuse ca Available în următorul ciclu de depunere.

Rezultatele de previzualizare DeepSeek-R1 și Qwen3-VL

NVIDIA a depus rezultatele de previzualizare Vera Rubin NVL72 pe DeepSeek-R1 și Qwen3-VL, pe care le-a descris ca fiind două dintre cele mai solicitante benchmark-uri din suita v6.1. Pe Qwen3-VL, compania a raportat o rată de procesare cu până la 3.7x mai mare decât GB300 NVL72 în scenariile offline, server și interactiv, utilizând vLLM cu cadrul de inferență open source NVIDIA Dynamo. Pe DeepSeek-R1, utilizând biblioteca NVIDIA TensorRT-LLM, NVIDIA a raportat o rată de procesare cu până la 2.5x mai mare decât GB300 NVL72.

Valorile citate pentru divizia Closed au fost preluate de pe mlcommons.org pe 16 septembrie 2026 și provin din înregistrările de depunere 6.1-0106 și 6.1-0074, conform citării publicate împreună cu rezultatele. NVIDIA a declarat că performanța înseamnă că fiecare rack Vera Rubin NVL72 livrează semnificativ mai multe tokenuri, deservește mai mulți utilizatori și generează mai multe venituri decât un rack GB300 NVL72, reducând în același timp costul pe token.

Nebius a depus, de asemenea, rezultate de previzualizare Vera Rubin NVL72 în aceeași rundă; NVIDIA a descris aceste rezultate ca demonstrând o performanță excelentă.

Co-proiectare hardware-software și testare agențială

NVIDIA a atribuit rezultatelor co-proiectarea completă a stivei hardware și software. Compania a declarat că Tensor Cores-urile și Transformer Engine-ul îmbunătățite ale Vera Rubin accelerează atât etapele de prefill, cât și cele de decode ale inferenței, în timp ce precizia NVFP4 reduce amprenta de memorie a greutăților modelului, a atenției și a cache-ului KV, sporind rata de procesare cu ceea ce NVIDIA a descris ca o pierdere minimă a calității ieșirii.

Depunerile au utilizat servirea dezagregată, care separă prefill și decode, împreună cu paralelism de expertiză la scară largă pe straturile mixture-of-experts utilizate de modele precum DeepSeek-R1 și Qwen3-VL. NVIDIA a declarat că domeniul de scalare NVL72, construit pe NVLink de generație a șasea și NVLink Switch, oferă rate de pachete de 10x mai mari și latență cu 3x mai mică decât Ethernet-ul standard, furnizând fundația de interconectare pentru aceste tehnici la scară de rack.

Compania a raportat, de asemenea, că Vera Rubin NVL72 a oferit o performanță de 30x mai bună decât GB300 NVL72 în testele de previzualizare pe benchmark-ul SemiAnalysis AgentX, conceput pentru a măsura sarcini de lucru agențiale. NVIDIA a declarat că viitorul benchmark MLPerf Endpoints va aduce o măsurare standardizată a sarcinilor de inferență agențiale, depășind ceea ce captează benchmark-urile tradiționale de debit.

Scalarea GB300 NVL72, câștiguri software și rezultate ale partenerilor

În aceeași rundă, depunerea DeepSeek-R1 a NVIDIA s-a scalat de la un singur rack GB300 NVL72 cu 72 de GPU-uri la patru rack-uri totalizând 288 de GPU-uri, realizând o eficiență de scalare de 99% în scenariul offline, cu o rată de procesare care a crescut aproape proporțional cu hardware-ul adăugat; compania a citat înregistrările 6.1-0073 și 6.1-0074. Pe benchmark-ul WAN 2.2 text-to-video, GB300 NVL72 a atins 0.65 de videoclipuri 720p pe secundă la 5.7 secunde pe videoclip, ceea ce NVIDIA a declarat că reprezintă o rată de procesare de 9x mai mare și o latență cu 7.5x mai mică decât un nod unic.

NVIDIA a raportat că performanța GB300 NVL72 pe Qwen3-VL s-a îmbunătățit cu până la 1.6x în v6.1 față de rezultatele din v6.0, atribuind acest lucru preciziei reduse a cache-ului KV, fuziunii suplimentare de kernel, kernel-urilor mai bune și serviri dezagregate cu vLLM și NVIDIA Dynamo. Compania a declarat că optimizarea a continuat după termenul limită de depunere v6.1 și că rezultatele post-depunere pe GPT-OSS-120B și DLRMv3 arată câștiguri suplimentare, deși aceste cifre nu au fost încă verificate de MLCommons.

Dincolo de platformele sale la scară de rack, NVIDIA a depus rezultate Jetson AGX Thor utilizând biblioteca TensorRT Edge-LLM pe noul benchmark Edge-Agentic cu modelul Qwen3.6-27B. Compania a declarat că 19 parteneri au participat la rundă, opt dintre ei depunând pe sisteme multi-node Blackwell NVL72: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro și Wiwynn.

MLCommons notează pe pagina sa de benchmark că rezultatele publicate sunt uneori modificate sau invalidate după publicarea inițială, iar orice modificări sunt înregistrate în jurnalul său de modificări.

Theo Nash este un specialist generat de inteligență artificială la Unite.AI, care acoperă infrastructura de inteligență artificială, calcul și sistemele hardware care alimentează inteligența artificială modernă. Lucrarea sa se concentrează pe fundamentele tehnice ale sarcinilor de lucru cu inteligență artificială la scară largă, incluzând centre de date, acceleratoare, rețele și stivele de software care le leagă împreună.
Cu o perspectivă analitică și inginerice, Theo examinează modul în care progresele în domeniul unităților de procesare grafică, siliciului personalizat, arhitecturilor de memorie și sistemelor distribuite permit noi generații de modele de inteligență artificială. El acordă o atenție deosebită schimburilor de performanță, eficienței energetice, scalabilității și constrângerilor practice care influențează implementarea în lumea reală a infrastructurii de inteligență artificială.
Articolele scrise de Theo Nash sunt generate de inteligență artificială și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea tehnică, claritatea și o acoperire responsabilă a peisajului de calcul cu inteligență artificială în evoluție rapidă.