نماذج ومنصات الذكاء الاصطناعي

نڤيديا فيرا روبين NVL72 تنشر أول نتائج معاينة MLPerf Inference

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أعلنت نڤيديا في 16 سبتمبر 2026 عن نتائج تقديم MLPerf Inference الإصدار 6.1، والتي تم تسليط الضوء عليها من خلال أول تقديم معاينة MLPerf Inference لنظامها فيرا روبين NVL72، حيث صرحت الشركة أن النظام يحقق معدل نقل بيانات أعلى يصل إلى 3.7 مرة مقارنةً بنظام GB300 NVL72 في معيار Qwen3-VL.

MLPerf Inference: Datacenter هو مجموعة معايير من جمعية للتعريفات المنشورة لـ MLCommons تقيس سرعة معالجة الأنظمة للمدخلات وإنتاج النتائج باستخدام نموذج مدرب. وفقًا لهذه التعريفات، تتطلب فئة Closed — الفئة التي أشارت إليها نڤيديا لأرقامها الرئيسية — استخدام نفس النموذج كتنفيذ مرجعي بحيث يمكن مقارنة منصات الأجهزة وأطر البرمجيات تفاح لتفاح، بينما يجب أن تكون الأنظمة في فئة التوافر Preview قابلة للتقديم كمتاحة في جولة التقديم التالية.

نتائج معاينة DeepSeek-R1 و Qwen3-VL

قدمت نڤيديا نتائج معاينة Vera Rubin NVL72 على DeepSeek-R1 و Qwen3-VL، ووصفتها بأنها من أكثر المعايير صعوبة في مجموعة v6.1. في معيار Qwen3-VL، أفادت الشركة بأن معدل النقل أعلى حتى 3.7 مرة مقارنةً بـ GB300 NVL72 عبر السيناريوهات غير المتصلة، الخادم، والتفاعلية، باستخدام vLLM مع إطار عمل الاستدلال المفتوح المصدر NVIDIA Dynamo. أما على DeepSeek-R1، فباستخدام مكتبة NVIDIA TensorRT-LLM، أبلغت نڤيديا عن معدل نقل أعلى حتى 2.5 مرة مقارنةً بـ GB300 NVL72.

تم استخراج أرقام فئة Closed المذكورة من موقع mlcommons.org في 16 سبتمبر 2026، وتستند إلى مداخل التقديم 6.1-0106 و 6.1-0074، وفقًا للاقتباس المنشور مع النتائج. صرحت نڤيديا أن هذه الأداء يعني أن كل رف Vera Rubin NVL72 يوفر عددًا أكبر بكثير من الرموز، يخدم عددًا أكبر من المستخدمين، ويولد إيرادات أعلى مقارنةً برف GB300 NVL72 مع خفض تكلفة كل رمز.

قدمت شركة Nebius أيضًا نتائج معاينة Vera Rubin NVL72 في نفس الجولة؛ وصفت نڤيديا تلك النتائج بأنها تُظهر أداءً ممتازًا.

التصميم المشترك للعتاد والبرمجيات واختبار الوكالية

نڤيديا أعادت الفضل إلى التصميم المتكامل عبر العتاد والبرمجيات للحصول على هذه النتائج. وأوضحت الشركة أن نوى Tensor Cores المحسّنة ومحرك Transformer في Vera Rubin يسرّعان كلًا من مرحلة الملء المسبق ومرحلة فك الترميز في الاستدلال، بينما تقلل دقة NVFP4 من البصمة الذاكرية لأوزان النموذج، والانتباه، وذاكرة KV المؤقتة، مما يزيد معدل النقل مع ما وصفته نڤيديا بأنه فقدان طفيف في جودة المخرجات.

استخدمت الطلبات خدمة غير مجمعة، التي تفصل بين مرحلة الملء المسبق وفك الترميز، إلى جانب التوازي الخبير على نطاق واسع عبر طبقات mixture-of-experts المستخدمة في نماذج مثل DeepSeek-R1 و Qwen3-VL. وأشارت نڤيديا إلى أن مجال توسيع NVL72، المبني على الجيل السادس من NVLink و NVLink Switch، يوفر معدلات حزم أعلى بـ 10 مرات وتأخيرًا أقل بـ 3 مرات مقارنةً بإيثرنت الجاهز، مما يوفر الأساس المتصل لتلك التقنيات على مستوى الرف.

كما أفادت الشركة أن Vera Rubin NVL72 قدم أداءً أفضل بـ 30 مرة مقارنةً بـ GB300 NVL72 في اختبار المعاينة على معيار SemiAnalysis AgentX، الذي صُمم لقياس أحمال العمل الوكالية. وذكرت نڤيديا أن معيار MLPerf Endpoints القادم سيُدخل قياسًا موحدًا لأحمال الاستدلال الوكالية بما يتجاوز ما تلتقطه معايير الإنتاجية التقليدية.

توسيع GB300 NVL72، مكاسب البرمجيات ونتائج الشركاء

في نفس الجولة، توسعت طلبية DeepSeek-R1 من نڤيديا من رف GB300 NVL72 واحد يحتوي على 72 وحدة معالجة رسومية إلى أربعة أرفاف بمجموع 288 وحدة معالجة رسومية، محققة كفاءة توسع بنسبة 99٪ في السيناريو غير المتصل، مع نمو معدل النقل تقريبًا بما يتناسب مع الزيادة في العتاد؛ وأشارت الشركة إلى المداخل 6.1-0073 و 6.1-0074. وفي معيار WAN 2.2 لتحويل النص إلى فيديو، وصل GB300 NVL72 إلى 0.65 فيديو بدقة 720p في الثانية بمدة 5.7 ثانية لكل فيديو، وهو ما وصفته نڤيديا بأنه يمثل معدل نقل أعلى بـ 9 مرات وتأخير أقل بـ 7.5 مرة مقارنةً بعقدة واحدة.

أفادت نڤيديا أن أداء GB300 NVL72 على Qwen3-VL تحسّن حتى 1.6 مرة في الإصدار v6.1 مقارنةً بنتائج v6.0، مع إرجاع الفضل إلى تقليل دقة ذاكرة KV المؤقتة، دمج إضافي للنوى، نوى أفضل وخدمة غير مجمعة باستخدام vLLM و NVIDIA Dynamo. وذكرت الشركة أن التحسين استمر بعد الموعد النهائي لتقديم v6.1، وأن نتائج ما بعد التقديم على GPT-OSS-120B و DLRMv3 تُظهر مكاسب إضافية، رغم أن هذه الأرقام لم يتم التحقق منها بعد من قبل MLCommons.

بعيدًا عن منصاتها على مستوى الرف، قدمت نڤيديا نتائج Jetson AGX Thor باستخدام مكتبة TensorRT Edge-LLM على معيار Edge-Agentic الجديد مع نموذج Qwen3.6-27B. وأوضحت الشركة أن 19 شريكًا شاركوا في الجولة، ثمانية منهم قدموا على أنظمة Blackwell NVL72 متعددة العقد: ASUS، Azure، Cisco، CoreWeave، Crusoe، Dell Technologies، Fujitsu، Giga Computing، HPE، Inventec، Lambda، MiTAC Computing، Nebius، Oracle Cloud Infrastructure، Quanta Cloud Technology، Red Hat، ScitiX، Supermicro و Wiwynn.

تشير ملاحظات MLCommons على صفحة معيارها إلى أن النتائج المنشورة قد تُعدَّل أو تُلغى أحيانًا بعد النشر الأولي، مع تسجيل أي تغييرات في سجل التغييرات الخاص بها.

ثيو ناش هو خبير في مجال الذكاء الاصطناعي في Unite.AI ، ويهتم ببنية تحتية للذكاء الاصطناعي والحوسبة والأنظمة المادية التي تعمل بالذكاء الاصطناعي الحديث. يركز عمله على الأسس الفنية خلف حمولات الذكاء الاصطناعي على نطاق واسع ، بما في ذلك مراكز البيانات والمسرعات والشبكات وبرامج التطبيقات التي تربطها معًا.
بمنظور تحليلي ومهندس مدفوع ، يفحص ثيو كيف تتيح التطورات في وحدات معالجة الرسومات والصمامات المخصصة وعمليات الذاكرة والأنظمة الموزعة لأجيال جديدة من نماذج الذكاء الاصطناعي. يهتم بشكل خاص بالتضحيات في الأداء والكفاءة في استهلاك الطاقة وال قابلية للتوسيع والقيود العملية التي تشكل النشر الفعلي للبنية التحتية للذكاء الاصطناعي.
المقالات التي كتبها ثيو ناش يتم إنشاؤها بواسطة الذكاء الاصطناعي ومراجعتها بواسطة فريق التحرير في Unite.AI لضمان الدقة الفنية والوضوح والتغطية المسؤولة للمناظر الحوسبية للذكاء الاصطناعي التي تتطور بسرعة.