एआई मॉडल और प्लेटफ़ॉर्म
NVIDIA Vera Rubin NVL72 ने पहला MLPerf Inference प्रीव्यू परिणाम प्रकाशित किए

NVIDIA ने 16 सितंबर, 2026 को अपनी MLPerf Inference v6.1 सबमिशन परिणाम प्रकाशित किए, जो उसके Vera Rubin NVL72 सिस्टम की पहली MLPerf Inference प्रीव्यू सबमिशन को प्रमुखता से दर्शाते हैं, जिसके अनुसार कंपनी ने कहा कि इसने Qwen3-VL बेंचमार्क पर अपने GB300 NVL72 सिस्टम की तुलना में अधिकतम 3.7 गुना उच्च थ्रूपुट प्रदान किया।
MLPerf Inference: Datacenter, MLCommons Association का एक बेंचमार्क सूट है जो यह मापता है कि प्रशिक्षित मॉडल का उपयोग करके सिस्टम इनपुट को कितनी तेज़ी से प्रोसेस करते हैं और परिणाम उत्पन्न करते हैं। MLCommons के प्रकाशित परिभाषाएँ के तहत, क्लोज़्ड डिवीजन — वह श्रेणी जिसे NVIDIA ने अपनी प्रमुख संख्याओं के लिए उद्धृत किया है — को रेफ़रेंस इम्प्लीमेंटेशन के समान मॉडल का उपयोग करना आवश्यक है ताकि हार्डवेयर प्लेटफ़ॉर्म और सॉफ़्टवेयर फ्रेमवर्क को “सेब‑से‑सेब” तुलना की जा सके, जबकि प्रीव्यू उपलब्धता श्रेणी के सिस्टम को अगले सबमिशन राउंड में उपलब्ध के रूप में प्रस्तुत किया जाना चाहिए।
DeepSeek-R1 और Qwen3-VL प्रीव्यू परिणाम
NVIDIA ने DeepSeek-R1 और Qwen3-VL पर Vera Rubin NVL72 प्रीव्यू परिणाम सबमिट किए, जिन्हें उसने v6.1 सूट के दो सबसे कठिन बेंचमार्क बताया। Qwen3-VL पर, कंपनी ने ऑफ़लाइन, सर्वर और इंटरैक्टिव परिदृश्यों में GB300 NVL72 की तुलना में अधिकतम 3.7 गुना उच्च थ्रूपुट रिपोर्ट किया, vLLM के साथ NVIDIA Dynamo ओपन सोर्स इनफ़रेंस फ्रेमवर्क का उपयोग करते हुए। DeepSeek-R1 पर, NVIDIA TensorRT-LLM लाइब्रेरी का उपयोग करते हुए, NVIDIA ने GB300 NVL72 की तुलना में अधिकतम 2.5 गुना उच्च थ्रूपुट रिपोर्ट किया।
उल्लेखित क्लोज़्ड डिवीजन आंकड़े 16 सितंबर, 2026 को mlcommons.org से प्राप्त किए गए थे, और परिणामों के साथ प्रकाशित उद्धरण के अनुसार सबमिशन एंट्री 6.1-0106 और 6.1-0074 से लिए गए हैं। NVIDIA ने कहा कि यह प्रदर्शन दर्शाता है कि प्रत्येक Vera Rubin NVL72 रैक GB300 NVL72 रैक की तुलना में काफी अधिक टोकन प्रदान करता है, अधिक उपयोगकर्ताओं की सेवा करता है और अधिक राजस्व उत्पन्न करता है, जबकि प्रति टोकन लागत कम करता है।
Nebius ने भी उसी राउंड में Vera Rubin NVL72 प्रीव्यू परिणाम सबमिट किए; NVIDIA ने उन परिणामों को उत्कृष्ट प्रदर्शन दर्शाते हुए वर्णित किया।
हार्डवेयर‑सॉफ़्टवेयर कोडिज़ाइन और एजेंटिक परीक्षण
NVIDIA ने परिणामों के लिए हार्डवेयर और सॉफ़्टवेयर में पूर्ण‑स्टैक कोडिज़ाइन को श्रेय दिया। कंपनी ने कहा कि Vera Rubin के उन्नत Tensor Cores और Transformer Engine इनफ़रेंस के प्रीफ़िल और डिकोड चरणों दोनों को तेज़ करते हैं, जबकि NVFP4 प्रिसीजन मॉडल वेट्स, अटेंशन और KV कैश की मेमोरी फुटप्रिंट को घटाता है, जिससे थ्रूपुट बढ़ता है, जिसे NVIDIA ने आउटपुट गुणवत्ता में न्यूनतम हानि के रूप में वर्णित किया।
सबमिशन ने डिसएग्रेगेटेड सर्विंग का उपयोग किया, जो प्रीफ़िल और डिकोड को अलग करता है, साथ ही DeepSeek-R1 और Qwen3-VL जैसे मॉडलों द्वारा उपयोग किए जाने वाले मिश्रण‑ऑफ़‑एक्सपर्ट्स लेयर्स में बड़े पैमाने पर विशेषज्ञ समानांतरता को जोड़ा। NVIDIA ने कहा कि छठी‑पीढ़ी के NVLink और NVLink Switch पर निर्मित NVL72 स्केल‑अप डोमेन ऑफ‑द‑शेल्फ़ ईथरनेट की तुलना में 10 गुना अधिक पैकेट रेट और 3 गुना कम लेटेंसी प्रदान करता है, जिससे रैक स्केल पर इन तकनीकों के लिए इंटरकनेक्ट आधार बनता है।
कंपनी ने यह भी रिपोर्ट किया कि Vera Rubin NVL72 ने SemiAnalysis AgentX बेंचमार्क पर प्रीव्यू परीक्षण में GB300 NVL72 की तुलना में 30 गुना बेहतर प्रदर्शन दिखाया, जिसे एजेंटिक वर्कलोड को मापने के लिए डिज़ाइन किया गया है। NVIDIA ने कहा कि आगामी MLPerf Endpoints बेंचमार्क एजेंटिक इनफ़रेंस वर्कलोड के लिए मानकीकृत मापन लाएगा, जो पारंपरिक थ्रूपुट बेंचमार्क से आगे है।
GB300 NVL72 स्केलिंग, सॉफ़्टवेयर लाभ और पार्टनर परिणाम
उसी राउंड में, NVIDIA की DeepSeek-R1 सबमिशन ने 72 GPUs वाले एकल GB300 NVL72 रैक से चार रैक्स में कुल 288 GPUs तक स्केल किया, ऑफ़लाइन परिदृश्य में 99% स्केलिंग दक्षता हासिल की, और थ्रूपुट लगभग हार्डवेयर के जोड़ के अनुपात में बढ़ा; कंपनी ने एंट्री 6.1-0073 और 6.1-0074 का उल्लेख किया। WAN 2.2 टेक्स्ट‑टू‑वीडियो बेंचमार्क पर, GB300 NVL72 ने प्रति सेकंड 0.65 720p वीडियो, प्रति वीडियो 5.7 सेकंड की दर हासिल की, जिसे NVIDIA ने एकल नोड की तुलना में 9 गुना उच्च थ्रूपुट और 7.5 गुना कम लेटेंसी के रूप में बताया।
NVIDIA ने रिपोर्ट किया कि Qwen3-VL पर GB300 NVL72 का प्रदर्शन v6.1 में v6.0 परिणामों की तुलना में अधिकतम 1.6 गुना सुधरा, जिसका श्रेय कम KV कैश प्रिसीजन, अतिरिक्त कर्नेल फ़्यूज़न, बेहतर कर्नेल और vLLM तथा NVIDIA Dynamo के साथ डिसएग्रेगेटेड सर्विंग को दिया गया। कंपनी ने कहा कि अनुकूलन v6.1 सबमिशन डेडलाइन के बाद भी जारी रहा, और GPT-OSS-120B और DLRMv3 पर पोस्ट‑सबमिशन परिणाम और अधिक सुधार दिखाते हैं, हालांकि उन आँकड़ों को अभी तक MLCommons द्वारा सत्यापित नहीं किया गया है।
अपने रैक‑स्केल प्लेटफ़ॉर्म से परे, NVIDIA ने TensorRT Edge-LLM लाइब्रेरी का उपयोग करके Qwen3.6-27B मॉडल के साथ नए परिचित Edge-Agentic बेंचमार्क पर Jetson AGX Thor परिणाम सबमिट किए। कंपनी ने कहा कि इस राउंड में 19 पार्टनर शामिल हुए, जिनमें से आठ ने मल्टी‑नोड Blackwell NVL72 सिस्टम पर सबमिशन किया: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro और Wiwynn।
MLCommons अपने बेंचमार्क पेज पर नोट करता है कि प्रकाशित परिणाम कभी‑कभी प्रारंभिक प्रकाशन के बाद संशोधित या अमान्य किए जाते हैं, और सभी परिवर्तन उसके परिवर्तन लॉग में दर्ज किए जाते हैं।












