Modelos y plataformas de IA
NVIDIA Vera Rubin NVL72 publica los primeros resultados preliminares de MLPerf Inference

NVIDIA, el 16 de septiembre de 2026, publicó sus MLPerf Inference v6.1 submission results, encabezados por la primera presentación preliminar de MLPerf Inference de su sistema Vera Rubin NVL72, que la empresa dijo entregó hasta 3.7x mayor rendimiento que su sistema GB300 NVL72 en el benchmark Qwen3-VL.
MLPerf Inference: Datacenter es una suite de referencia de la asociación MLCommons que mide la velocidad con la que los sistemas procesan entradas y generan resultados usando un modelo entrenado. Según definiciones publicadas por MLCommons, la división Closed — la categoría que NVIDIA citó para sus cifras principales — requiere usar el mismo modelo que la implementación de referencia para que las plataformas de hardware y los marcos de software puedan compararse “manzana con manzana”, mientras que los sistemas en la categoría de disponibilidad Preview deben poder enviarse como Available en la próxima ronda de presentaciones.
Resultados preliminares de DeepSeek-R1 y Qwen3-VL
NVIDIA presentó los resultados preliminares de Vera Rubin NVL72 en DeepSeek-R1 y Qwen3-VL, que describió como dos de los benchmarks más exigentes de la suite v6.1. En Qwen3-VL, la empresa informó hasta 3.7x mayor rendimiento que GB300 NVL72 en los escenarios offline, server e interactivo, utilizando vLLM con el framework de inferencia de código abierto NVIDIA Dynamo. En DeepSeek-R1, usando la biblioteca NVIDIA TensorRT-LLM, NVIDIA reportó un rendimiento de hasta 2.5x superior al de GB300 NVL72.
Las cifras citadas de la división Closed se obtuvieron de mlcommons.org el 16 de septiembre de 2026 y provienen de las entradas de presentación 6.1-0106 y 6.1-0074, según la cita publicada con los resultados. NVIDIA dijo que el rendimiento significa que cada rack Vera Rubin NVL72 entrega significativamente más tokens, atiende a más usuarios y genera más ingresos que un rack GB300 NVL72, al tiempo que reduce el costo por token.
Nebius también presentó resultados preliminares de Vera Rubin NVL72 en la misma ronda; NVIDIA describió esos resultados como una demostración de un rendimiento excelente.
Co‑diseño de hardware y software y pruebas agenticas
NVIDIA atribuyó los resultados al co‑diseño de pila completa entre hardware y software. La empresa dijo que los Tensor Cores mejorados y el Transformer Engine de Vera Rubin aceleran tanto las etapas de pre‑llenado como de decodificación de la inferencia, mientras que la precisión NVFP4 reduce la huella de memoria de los pesos del modelo, la atención y la caché KV, aumentando el rendimiento con lo que NVIDIA describió como una pérdida mínima de calidad de salida.
Las presentaciones utilizaron servicio desagregado, que separa el pre‑llenado y la decodificación, junto con paralelismo de expertos a gran escala en las capas de mezcla de expertos usadas por modelos como DeepSeek-R1 y Qwen3-VL. NVIDIA dijo que el dominio de escalado NVL72, construido sobre la sexta generación de NVLink y NVLink Switch, ofrece tasas de paquetes 10x mayores y una latencia 3x menor que el Ethernet convencional, proporcionando la base de interconexión para esas técnicas a escala de rack.
La empresa también informó que Vera Rubin NVL72 entregó un rendimiento 30x mejor que GB300 NVL72 en pruebas preliminares con el benchmark SemiAnalysis AgentX, diseñado para medir cargas de trabajo agenticas. NVIDIA dijo que el próximo benchmark MLPerf Endpoints aportará una medición estandarizada a las cargas de trabajo de inferencia agentica más allá de lo que capturan los benchmarks tradicionales de rendimiento.
Escalado de GB300 NVL72, mejoras de software y resultados de socios
En la misma ronda, la presentación de DeepSeek-R1 de NVIDIA escaló de un único rack GB300 NVL72 de 72 GPU a cuatro racks con un total de 288 GPU, logrando un 99 % de eficiencia de escalado en el escenario offline, con un rendimiento que creció casi en proporción al hardware añadido; la empresa citó las entradas 6.1-0073 y 6.1-0074. En el benchmark WAN 2.2 de texto a video, GB300 NVL72 alcanzó 0,65 videos 720p por segundo a 5,7 segundos por video, lo que NVIDIA dijo representa un rendimiento 9x mayor y una latencia 7,5x menor que un nodo único.
NVIDIA informó que el rendimiento de GB300 NVL72 en Qwen3-VL mejoró hasta 1,6x en v6.1 respecto a sus resultados v6.0, atribuyendo la mejora a una menor precisión de la caché KV, fusión adicional de kernels, kernels más eficientes y servicio desagregado con vLLM y NVIDIA Dynamo. La empresa dijo que la optimización continuó después de la fecha límite de presentación de v6.1, y que los resultados posteriores a la presentación en GPT-OSS-120B y DLRMv3 muestran ganancias adicionales, aunque esas cifras aún no han sido verificadas por MLCommons.
Más allá de sus plataformas a escala de rack, NVIDIA presentó resultados de Jetson AGX Thor usando la biblioteca TensorRT Edge-LLM en el recién introducido benchmark Edge-Agentic con el modelo Qwen3.6-27B. La empresa dijo que 19 socios participaron en la ronda, ocho de ellos presentando en sistemas Blackwell NVL72 multinodo: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro y Wiwynn.
MLCommons señala en su página de benchmarks que los resultados publicados a veces se modifican o invalidan después de la publicación inicial, y cualquier cambio se registra en su registro de cambios.












