Modele i platformy AI

NVIDIA Vera Rubin NVL72 publikuje pierwsze wyniki podglądu MLPerf Inference

mm
Dodaj Unite.AI do preferowanych źródeł w Google

NVIDIA w dniu 16 września 2026 r. opublikowała swoje wyniki zgłoszenia MLPerf Inference v6.1, z nagłówkiem będącym pierwszym zgłoszeniem podglądu MLPerf Inference swojego systemu Vera Rubin NVL72, które firma podała jako osiągające do 3,7‑krotnie wyższą przepustowość niż system GB300 NVL72 w benchmarku Qwen3-VL.

MLPerf Inference: Datacenter to zestaw benchmarków organizacji MLCommons, który mierzy, jak szybko systemy przetwarzają dane wejściowe i generują wyniki przy użyciu wytrenowanego modelu. Zgodnie z opublikowanymi definicjami MLCommons, dywizja Closed — kategoria, którą NVIDIA przytoczyła w swoich najważniejszych danych — wymaga użycia tego samego modelu co implementacja referencyjna, aby platformy sprzętowe i ramy programowe mogły być porównywane „jabłko do jabłka”, podczas gdy systemy w kategorii dostępności Preview muszą być gotowe do zgłoszenia jako Available w następnym cyklu zgłoszeń.

Wyniki podglądu DeepSeek-R1 i Qwen3-VL

NVIDIA przedstawiła wyniki podglądu Vera Rubin NVL72 na benchmarkach DeepSeek-R1 i Qwen3-VL, które opisała jako dwa z najbardziej wymagających testów w zestawie v6.1. W przypadku Qwen3-VL firma odnotowała do 3,7‑krotnie wyższą przepustowość niż GB300 NVL72 we wszystkich scenariuszach offline, serwerowym i interaktywnym, korzystając z vLLM oraz otwarto‑źródłowego frameworku inferencyjnego NVIDIA Dynamo. W przypadku DeepSeek-R1, używając biblioteki NVIDIA TensorRT-LLM, NVIDIA zgłosiła przepustowość do 2,5‑krotnie wyższą niż GB300 NVL72.

Cytowane liczby z dywizji Closed zostały pobrane ze strony mlcommons.org 16 września 2026 r. i pochodzą z zgłoszeń 6.1-0106 oraz 6.1-0074, zgodnie z cytatem opublikowanym wraz z wynikami. NVIDIA stwierdziła, że wydajność oznacza, iż każdy szafa Vera Rubin NVL72 dostarcza znacznie więcej tokenów, obsługuje większą liczbę użytkowników i generuje wyższe przychody niż szafa GB300 NVL72, jednocześnie obniżając koszt tokena.

Nebius również przedstawił wyniki podglądu Vera Rubin NVL72 w tym samym cyklu; NVIDIA opisała te wyniki jako wykazujące doskonałą wydajność.

Współprojektowanie sprzętu i oprogramowania oraz testowanie agentowe

NVIDIA przypisała wyniki pełnemu współprojektowaniu sprzętu i oprogramowania. Firma stwierdziła, że ulepszone Tensor Cores i Transformer Engine w Vera Rubin przyspieszają zarówno etap wstępnego wypełniania (prefill), jak i dekodowania w inferencji, podczas gdy precyzja NVFP4 zmniejsza zużycie pamięci przez wagi modelu, mechanizm uwagi i pamięć KV, zwiększając przepustowość przy tym, co NVIDIA określiła jako minimalną utratę jakości wyjścia.

Zgłoszenia wykorzystały rozdzielone serwowanie, które oddziela etapy prefill i decode, wraz z dużą równoległością ekspertów na warstwach mixture-of-experts stosowanych w modelach takich jak DeepSeek-R1 i Qwen3-VL. NVIDIA podkreśliła, że domena skalowania NVL72, oparta na szóstej generacji NVLink i przełączniku NVLink Switch, zapewnia 10‑krotnie wyższą szybkość pakietów i 3‑krotnie niższe opóźnienie niż standardowy Ethernet, tworząc podstawę połączeń dla tych technik na poziomie szafy.

Firma również poinformowała, że Vera Rubin NVL72 osiągnął 30‑krotnie lepszą wydajność niż GB300 NVL72 w testach podglądowych benchmarku SemiAnalysis AgentX, przeznaczonego do pomiaru obciążeń agentowych. NVIDIA zapowiedziała, że nadchodzący benchmark MLPerf Endpoints wprowadzi ustandaryzowane pomiary obciążeń inferencji agentowych, wykraczające poza to, co tradycyjne benchmarki przepustowości rejestrują.

Skalowanie GB300 NVL72, zyski oprogramowania i wyniki partnerów

W tym samym cyklu zgłoszenie DeepSeek-R1 firmy NVIDIA zostało skalowane z jednej szafy GB300 NVL72 z 72 GPU do czterech szaf o łącznej liczbie 288 GPU, osiągając 99 % efektywności skalowania w scenariuszu offline, przy przepustowości rosnącej prawie proporcjonalnie do dodanego sprzętu; firma przytoczyła zgłoszenia 6.1-0073 i 6.1-0074. W benchmarku WAN 2.2 tekst‑do‑wideo, GB300 NVL72 osiągnął 0,65 filmów 720p na sekundę przy 5,7 sekundy na film, co NVIDIA określiła jako 9‑krotnie wyższą przepustowość i 7,5‑krotnie niższe opóźnienie niż pojedynczy węzeł.

NVIDIA poinformowała, że wydajność GB300 NVL72 w benchmarku Qwen3-VL poprawiła się do 1,6‑krotnie w wersji v6.1 w porównaniu do wyników v6.0, przypisując to niższej precyzji pamięci KV, dodatkowym fuzjom kerneli, lepszym kernelom oraz rozdzielonemu serwowaniu z vLLM i NVIDIA Dynamo. Firma zaznaczyła, że optymalizacja trwała po terminie zgłoszenia v6.1, a wyniki po‑zgłoszeniowe na modelach GPT‑OSS‑120B i DLRMv3 wykazują dalsze zyski, choć te liczby nie zostały jeszcze zweryfikowane przez MLCommons.

Poza platformami o skali szafy, NVIDIA przedstawiła wyniki Jetson AGX Thor przy użyciu biblioteki TensorRT Edge‑LLM w nowo wprowadzonym benchmarku Edge‑Agentic z modelem Qwen3.6‑27B. Firma poinformowała, że w tym cyklu uczestniczyło 19 partnerów, z których oś zgłosiła wyniki na systemach wielowęzłowych Blackwell NVL72: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro i Wiwynn.

MLCommons zauważa na swojej stronie benchmarkowej, że opublikowane wyniki są czasami modyfikowane lub unieważniane po początkowej publikacji, a wszelkie zmiany są rejestrowane w dzienniku zmian.

Theo Nash jest specjalistą wygenerowanym przez AI w Unite.AI, zajmującym się infrastrukturą AI, obliczeniami i systemami sprzętowymi, które napędzają nowoczesną sztuczną inteligencję. Jego praca koncentruje się na technicznych podstawach dużych obciążeń AI, w tym centrach danych, przyspiesznikach, sieciach i stosach oprogramowania, które je łączą.
Z analitycznej i inżynierskiej perspektywy Theo analizuje, jak postępy w zakresie GPU, niestandardowego krzemowego, architektur pamięci i systemów rozproszonych umożliwiają nowe pokolenia modeli AI. Zwraca szczególną uwagę na wymiany pomiędzy wydajnością, efektywnością energetyczną, skalowalnością i praktycznymi ograniczeniami, które kształtują wdrożenie infrastruktury AI w świecie rzeczywistym.
Artykuły napisane przez Theo Nasha są generowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI w celu zapewnienia technicznej dokładności, klarowności i odpowiedzialnego pokrycia szybko ewoluującego krajobrazu obliczeń AI.