Yapay zeka modelleri ve platformları
NVIDIA Vera Rubin NVL72 İlk MLPerf Inference Önizleme Sonuçlarını Yayınladı

NVIDIA, 16 Eylül 2026 tarihinde, MLPerf Inference v6.1 gönderim sonuçlarını yayınladı; bu, Vera Rubin NVL72 sisteminin ilk MLPerf Inference önizleme gönderimiyle öne çıkıyor ve şirket, bu sistemin Qwen3-VL benchmark’unda GB300 NVL72 sistemine kıyasla 3,7 kat daha yüksek işlem hacmi sağladığını belirtti.
MLPerf Inference: Datacenter, MLCommons Association’a ait bir benchmark paketidir ve eğitimli bir modeli kullanarak sistemlerin girdileri ne kadar hızlı işlediğini ve sonuç ürettiğini ölçer. MLCommons’ın yayımlanan tanımları kapsamında, NVIDIA’nın başlık rakamları için belirttiği Closed bölümü, donanım platformları ve yazılım çerçevelerinin “elma elmaya” karşılaştırılabilmesi için referans uygulama ile aynı modelin kullanılmasını şart koşar; Preview kullanılabilirlik kategorisindeki sistemlerin ise bir sonraki gönderim turunda Available olarak sunulabilir olması gerekir.
DeepSeek-R1 ve Qwen3-VL Önizleme Sonuçları
NVIDIA, DeepSeek-R1 ve Qwen3-VL üzerinde Vera Rubin NVL72 önizleme sonuçlarını sundu ve bunları v6.1 paketindeki en zorlu benchmarklardan ikisi olarak tanımladı. Qwen3-VL’de şirket, offline, sunucu ve etkileşimli senaryolarda vLLM ve NVIDIA Dynamo açık kaynaklı çıkarım çerçevesi kullanarak GB300 NVL72’ye kıyasla 3,7 kat daha yüksek işlem hacmi rapor etti. DeepSeek-R1’de ise NVIDIA TensorRT-LLM kütüphanesini kullanarak GB300 NVL72’ye kıyasla 2,5 kat daha yüksek işlem hacmi bildirdi.
Bahsi geçen Closed bölümü rakamları, 16 Eylül 2026 tarihinde mlcommons.org’dan alındı ve sonuçlarla birlikte yayınlanan atıfa göre 6.1-0106 ve 6.1-0074 gönderim girişlerinden elde edildi. NVIDIA, bu performansın her Vera Rubin NVL72 rafının GB300 NVL72 rafına göre çok daha fazla token ürettiğini, daha fazla kullanıcıya hizmet verdiğini ve daha fazla gelir sağladığını, aynı zamanda token başına maliyeti azalttığını belirtti.
Nebius da aynı turda Vera Rubin NVL72 önizleme sonuçlarını sundu; NVIDIA bu sonuçları mükemmel performans sergilediği şeklinde tanımladı.
Donanım-Yazılım Ortak Tasarımı ve Agentik Testler
NVIDIA, sonuçlar için donanım ve yazılım arasında tam yığın ortak tasarımına (full-stack codesign) atıfta bulundu. Şirket, Vera Rubin’in geliştirilmiş Tensor Çekirdekleri ve Transformer Motorunun çıkarımın ön doldurma ve kod çözme aşamalarını hızlandırdığını, NVFP4 hassasiyetinin ise model ağırlıkları, dikkat ve KV önbelleğinin bellek ayak izini azalttığını, böylece NVIDIA’nın çıktının kalitesinde minimal kayıp olarak tanımladığı bir durumla işlem hacmini artırdığını belirtti.
Gönderimler, ön doldurma ve kod çözmeyi ayıran ayrık hizmet (disaggregated serving) yöntemini, DeepSeek-R1 ve Qwen3-VL gibi modellerin kullandığı mixture-of-experts katmanları boyunca büyük ölçekli uzman paralelliğiyle birleştirdi. NVIDIA, altıncı nesil NVLink ve NVLink Switch üzerine inşa edilen NVL72 ölçekleme alanının, raf ölçeğinde bu teknikler için bağlantı temelini sağlayarak, hazır Ethernet’e kıyasla paket oranlarını 10 kat, gecikmeyi ise 3 kat düşürdüğünü belirtti.
Şirket ayrıca, Vera Rubin NVL72’nin, agentik iş yüklerini ölçmek için tasarlanmış SemiAnalysis AgentX benchmark’unda önizleme testlerinde GB300 NVL72’ye kıyasla 30 kat daha iyi performans sağladığını rapor etti. NVIDIA, yaklaşan MLPerf Endpoints benchmark’ının geleneksel işlem hacmi benchmark’larının ötesinde agentik çıkarım iş yükleri için standart ölçüm getireceğini belirtti.
GB300 NVL72 Ölçekleme, Yazılım Kazançları ve Ortak Sonuçları
Aynı turda, NVIDIA’nın DeepSeek-R1 gönderimi, 72 GPU’lu tek bir GB300 NVL72 rafından 288 GPU’lu dört rafına ölçeklendirildi ve offline senaryoda %99 ölçekleme verimliliği elde edildi; işlem hacmi eklenen donanımla neredeyse orantılı olarak arttı; şirket 6.1-0073 ve 6.1-0074 girişlerine atıfta bulundu. WAN 2.2 metin‑video benchmark’unda GB300 NVL72, saniyede 0,65 adet 720p video ve video başına 5,7 saniye süresi elde etti; NVIDIA bu değerin tek bir düğüme göre 9 kat daha yüksek işlem hacmi ve 7,5 kat daha düşük gecikme sağladığını belirtti.
NVIDIA, GB300 NVL72’nin Qwen3-VL üzerindeki performansının v6.0 sonuçlarına göre v6.1’de 1,6 kat iyileştiğini, bu iyileşmenin daha düşük KV önbellek hassasiyeti, ek kernel birleştirme, daha iyi kernel’lar ve vLLM ile NVIDIA Dynamo kullanılarak ayrık hizmetten kaynaklandığını bildirdi. Şirket, optimizasyonun v6.1 gönderim son tarihinden sonra da devam ettiğini ve GPT-OSS-120B ve DLRMv3 üzerindeki gönderim sonrası sonuçların daha fazla kazanç gösterdiğini, ancak bu rakamların henüz MLCommons tarafından doğrulanmadığını belirtti.
Raf ölçeğindeki platformlarının ötesinde, NVIDIA, Qwen3.6-27B modeliyle yeni tanıtılan Edge-Agentic benchmark’unda TensorRT Edge-LLM kütüphanesini kullanarak Jetson AGX Thor sonuçlarını sundu. Şirket, bu turda 19 ortağın yer aldığını ve bunların sekizinin çok düğümlü Blackwell NVL72 sistemlerinde gönderim yaptığını belirtti: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro ve Wiwynn.
MLCommons, benchmark sayfasında yayınlanan sonuçların bazen ilk yayınlandıktan sonra değiştirilebileceğini veya geçersiz kılınabileceğini ve tüm değişikliklerin değişiklik günlüğünde kaydedildiğini belirtir.












