Modèles et plateformes d’IA

NVIDIA Vera Rubin NVL72 publie les premiers résultats d’aperçu MLPerf Inference

mm
Ajouter Unite.AI à vos sources préférées sur Google

NVIDIA le 16 septembre 2026 a publié ses résultats de soumission MLPerf Inference v6.1, intitulés par la première soumission d’aperçu MLPerf Inference de son système Vera Rubin NVL72, que la société a déclaré offrir jusqu’à 3.7x plus de débit que son système GB300 NVL72 sur le benchmark Qwen3-VL.

MLPerf Inference : Datacenter est une suite de benchmarks de l’Association MLCommons qui mesure la rapidité avec laquelle les systèmes traitent les entrées et produisent des résultats à l’aide d’un modèle entraîné. Selon les définitions publiées par MLCommons, la division Closed — catégorie citée par NVIDIA pour ses chiffres principaux — exige l’utilisation du même modèle que l’implémentation de référence afin que les plateformes matérielles et les cadres logiciels puissent être comparés “pomme à pomme,” tandis que les systèmes de la catégorie de disponibilité Preview doivent pouvoir être soumis comme Available lors du prochain cycle de soumission.

Résultats d’aperçu DeepSeek-R1 et Qwen3-VL

NVIDIA a soumis les résultats d’aperçu Vera Rubin NVL72 sur DeepSeek-R1 et Qwen3-VL, qu’elle a décrits comme deux des benchmarks les plus exigeants de la suite v6.1. Sur Qwen3-VL, la société a indiqué un débit jusqu’à 3.7x supérieur à celui du GB300 NVL72 dans les scénarios hors ligne, serveur et interactif, en utilisant vLLM avec le cadre d’inférence open source NVIDIA Dynamo. Sur DeepSeek-R1, en utilisant la bibliothèque NVIDIA TensorRT-LLM, NVIDIA a rapporté un débit jusqu’à 2.5x supérieur à celui du GB300 NVL72.

Les chiffres de la division Closed cités ont été récupérés sur mlcommons.org le 16 septembre 2026 et proviennent des entrées de soumission 6.1-0106 et 6.1-0074, selon la citation publiée avec les résultats. NVIDIA a déclaré que cette performance signifie que chaque rack Vera Rubin NVL72 délivre nettement plus de jetons, sert davantage d’utilisateurs et génère plus de revenus qu’un rack GB300 NVL72 tout en réduisant le coût par jeton.

Nebius a également soumis les résultats d’aperçu Vera Rubin NVL72 lors du même cycle ; NVIDIA a décrit ces résultats comme démontrant d’excellentes performances.

Codesign matériel-logiciel et tests agentiques

NVIDIA a attribué les résultats à un codesign full‑stack couvrant le matériel et le logiciel. La société a indiqué que les Tensor Cores améliorés et le Transformer Engine de Vera Rubin accélèrent à la fois les étapes de préremplissage et de décodage de l’inférence, tandis que la précision NVFP4 réduit l’empreinte mémoire des poids du modèle, de l’attention et du cache KV, augmentant le débit avec ce que NVIDIA décrit comme une perte minimale de qualité de sortie.

Les soumissions ont utilisé le service désagrégé, qui sépare le préremplissage et le décodage, ainsi qu’un parallélisme d’experts à grande échelle à travers les couches mixture‑of‑experts utilisées par des modèles tels que DeepSeek‑R1 et Qwen3‑VL. NVIDIA a indiqué que le domaine de montée en échelle NVL72, construit sur la sixième génération de NVLink et le NVLink Switch, offre des taux de paquets 10× supérieurs et une latence 3× inférieure à celle d’Ethernet standard, fournissant la base d’interconnexion pour ces techniques à l’échelle du rack.

La société a également indiqué que Vera Rubin NVL72 a offert des performances 30× supérieures à celles du GB300 NVL72 lors des tests d’aperçu sur le benchmark SemiAnalysis AgentX, conçu pour mesurer les charges de travail agentiques. NVIDIA a déclaré que le prochain benchmark MLPerf Endpoints introduira une mesure standardisée des charges de travail d’inférence agentiques, au-delà de ce que capturent les benchmarks de débit traditionnels.

Mise à l’échelle du GB300 NVL72, gains logiciels et résultats des partenaires

Lors du même cycle, la soumission DeepSeek‑R1 de NVIDIA est passée d’un seul rack GB300 NVL72 de 72 GPU à quatre racks totalisant 288 GPU, atteignant une efficacité d’échelle de 99 % dans le scénario hors ligne, le débit augmentant presque proportionnellement au matériel ajouté ; la société a cité les entrées 6.1‑0073 et 6.1‑0074. Sur le benchmark WAN 2.2 texte‑vers‑vidéo, le GB300 NVL72 a atteint 0,65 vidéos 720p par seconde à 5,7 secondes par vidéo, ce que NVIDIA a indiqué représenter un débit 9 × supérieur et une latence 7,5 × inférieure à celle d’un nœud unique.

NVIDIA a indiqué que les performances du GB300 NVL72 sur Qwen3‑VL se sont améliorées jusqu’à 1,6× en v6.1 par rapport à ses résultats v6.0, attribuant cela à une précision de cache KV plus faible, à une fusion supplémentaire de noyaux, à de meilleurs noyaux et au service désagrégé avec vLLM et NVIDIA Dynamo. La société a déclaré que l’optimisation s’est poursuivie au-delà de la date limite de soumission v6.1, et que les résultats post‑soumission sur GPT‑OSS‑120B et DLRMv3 montrent des gains supplémentaires, bien que ces chiffres n’aient pas encore été vérifiés par MLCommons.

Au‑delà de ses plateformes à l’échelle du rack, NVIDIA a soumis les résultats Jetson AGX Thor en utilisant la bibliothèque TensorRT Edge‑LLM sur le benchmark Edge‑Agentic récemment introduit avec le modèle Qwen3.6‑27B. La société a indiqué que 19 partenaires ont participé à ce cycle, dont huit ont soumis sur des systèmes Blackwell NVL72 multi‑nœuds : ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro et Wiwynn.

MLCommons indique sur sa page de benchmark que les résultats publiés sont parfois modifiés ou invalidés après leur publication initiale, toute modification étant consignée dans son journal des changements.

Théo Nash est un spécialiste généré par IA chez Unite.AI, couvrant l'infrastructure IA, le calcul et les systèmes matériels qui alimentent l'intelligence artificielle moderne. Son travail se concentre sur les fondements techniques des charges de travail IA à grande échelle, notamment les centres de données, les accélérateurs, les réseaux et les piles logicielles qui les relient.
Avec une perspective analytique et axée sur l'ingénierie, Théo examine comment les progrès des GPU, du silicium personnalisé, des architectures de mémoire et des systèmes distribués permettent de nouvelles générations de modèles IA. Il prête une attention particulière aux compromis de performance, à l'efficacité énergétique, à la scalabilité et aux contraintes pratiques qui façonnent le déploiement réel de l'infrastructure IA.
Les articles rédigés par Théo Nash sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude technique, la clarté et la couverture responsable du paysage de calcul IA en évolution rapide.