نماذج ومنصات الذكاء الاصطناعي
NVIDIA تصدر نموذج المتحدث المفتوح الوزن Nemotron 3 للتفريق الصوتي

أعلنت NVIDIA في 23 سبتمبر 2026 عن Nemotron 3 Diarization، وهو نموذج تفريق صوتي مفتوح الوزن يحدد ما يصل إلى ثمانية متحدثين في الصوت الحي أو المسجل، وأعلنت Baseten عن دعم الخدمة في نفس اليوم مع إعدادات مسبقة للدفعات والبث والتفريغ النصي المفرق، حيث يعمل كل منها على وحدة معالجة رسومات RTX PRO 6000 واحدة.
يقوم تفريق المتحدثين بتقسيم تدفق الصوت حسب متى يتحدث كل متحدث مميز، ويخرج توقيتات لكل صوت، ويُعطي كل مقطع تسمية ثابتة؛ وعند إقرانه بالتفريغ النصي، ينسب الكلمات المفروضة إلى الشخص الذي نطقها. إعلان Baseten يصف Nemotron 3 Diarization كنموذج مفتوح من طرف إلى طرف يستبدل خط أنابيب التقسيم + التضمين التقليدي وتعديله بمرور واحد، ويُصنّف المتحدثين بفاصل يمكن ضبطه يصل إلى كل 320 مللي ثانية.
البنية وملفات تعريف الكمون
وفقًا بطاقة نموذج NVIDIA، صُمم النموذج لتحديد “من تحدث ومتى” في الصوت الواقعي، ويدعم كل من البث والاستدلال غير المتصل، وهو جاهز للاستخدام التجاري أو غير التجاري. وهو مشفر Transformer مكوّن من 100 مليون معامل، 31 طبقة، مع تضمينات موضعية دوارة. يتم تحويل الصوت أحادي القناة الوارد بتردد 16 كيلوهرتز إلى إطارات طيفية ميل بمدة 10 مللي ثانية، ثم يُخفض بمقدار ثمانية أضعاف إلى معدل إطارات مشفر 80 مللي ثانية، وتقوم طبقة Conv1D فوق المشفر بترقية التنبؤات إلى دقة الإدخال 10 مللي ثانية. يُخرج النموذج موترًا لاحتمالات نشاط كل متحدث بالشكل T, 8، وتُرتب قنوات المتحدثين الثمانية بحسب وصول كل متحدث لأول مرة في الصوت.
في وضع البث، يستخدم النموذج ذاكرة التخزين المؤقت للمتحدثين حسب ترتيب الوصول وطابور FIFO الذي تم تقديمه في عمل Streaming Sortformer من NVIDIA: تحتفظ الذاكرة بمعلومات المتحدث من القطع السابقة بحيث يبقى التصنيف للمتحدث الأول، بينما يوفّر الطابور سياق الإطارات الأخيرة لكل خطوة معالجة. لا يتطلب التصميم أي تضمينات أو تجميع، ولا يفرض الاستدلال المجزأ أي حد ثابت لمدة الصوت.
نقطة فحص واحدة تخدم أربعة تكوينات كمون موصى بها: 0.32، 0.64، و1.04 ثانية، بالإضافة إلى مخزن إدخال غير متصل بطول 30.4 ثانية. تُعرّف البطاقة هذا الكمون على أنه كمون مخزن الإدخال — طول القطعة زائد السياق الأيمن، مضروبًا في 80 مللي ثانية — وتُشير إلى أن الرقم لا يشمل زمن المعالجة الحوسبية. يمكن تشغيل نقطة الفحص بمخزن صغير يصل إلى 80 مللي ثانية، رغم أن 0.32 ثانية هي أقل تكوين موصى به، ويمكن ضبط دقة إطار الإخراج على مضاعفات 10 مللي ثانية.
الدقة والسرعة المبلغ عنها
تُبلغ بطاقة نموذج NVIDIA عن معدل خطأ التفريق الصوتي، ودقة عد المتحدثين، ومتوسط الخطأ المطلق لعد المتحدثين مقارنةً بـ diar_streaming_sortformer_4spk-v2.1 الخط الأساسي، مع تضمين الكلام المتداخل وتطبيق طوق زمني صفر ثانية على كل معيار باستثناء CALLHOME-Part2 الذي يستخدم طوقًا زمنيًا قدره 0.25 ثانية. في DIHARD III، تُبلغ البطاقة عن معدل خطأ كامل مجموعة قدره 12.73 في ملف تعريف 30.4 ثانية و13.55 في 0.32 ثانية، مقابل 19.09 و19.85 للخط الأساسي. في تسجيلات NOTSOFAR1 ذات القناة الواحدة تُبلغ عن 11.00 مقابل 30.49 في ملف تعريف غير متصل؛ في اختبار AMI SDM، 11.14 مقابل 21.42؛ في اختبار AliMeeting Near، 6.40 مقابل 11.57؛ وعلى CALLHOME-Part2، 9.10 مقابل 10.32. تُشير البطاقة إلى أن درجات AMI وAliMeeting وNOTSOFAR1 تم حسابها باستخدام تسميات مرجعية محاذاة قسرية وأن النتائج المقاسة ضد تعليقات مرجعية مختلفة لا يمكن مقارنتها مباشرة.
جدول السرعة في البطاقة يُبلغ عن تسريع عامل الوقت الحقيقي، يُعرّف بأنه مدة الصوت الكلية مقسومة على زمن المعالجة الكلي، بقيمة 1,340 في الوضع المتحمس و4,385 في الوضع المُجمّع بحجم دفعة واحد على ملف تعريف غير متصل، تم قياسه على RTX PRO 5000 بدقة BF16. في ملف تعريف 0.32 ثانية، الأرقام المقابلة هي 12.5 و54.
قامت Baseten بإجراء تقييمها الخاص، حيث سجلت أيضًا معدل خطأ مع تضمين الكلام المتداخل دون طوق. تُبلغ عن معدل خطأ بنسبة 9.8٪ على AISHELL-4 في ملف تعريف الكمون المنخفض مقابل 27.2٪ لـ Streaming Sortformer v2.1، وتقول إن الانتقال من ملف تعريف غير متصل بمدة 30 ثانية إلى ملف تعريف فائق المنخفض بمدة 0.32 ثانية يرفع معدل الخطأ بنقطة أو نقطتين فقط. تُفيد Baseten أن النموذج تفوق Meta Muse Voice Transcribe في كل مجموعة بيانات اختبرتها، حتى في التكوين فائق المنخفض، وخسر أمام pyannote community-1 فقط في AMI.
بيانات التدريب والترخيص
تُدرج بطاقة النموذج حوالي 10,000 ساعة من المحادثات الحقيقية (بما في ذلك Fisher English، ومجموعات اجتماعات AMI و ICSI، وVoxConverse، وAISHELL-4، وAliMeeting، وتحدي DIHARD الثالث، وCALLHOME، وNOTSOFAR1، ومجموعات DISPLACE، وتسجيلات David AI المرخصة، ومجموعة فرعية مُصنّفة بشكل زائف YODAS-v2) إلى جانب 82,611 ساعة من خلطات متعددة المتحدثين مُحاكاة باستخدام مجموعة أدوات FastMSS من حوالي 28,000 ساعة من تسجيلات متحدث واحد. بدأ التدريب من نقطة فحص NEST ذاتية الإشراف وتم تنفيذها على ثمانية عقد كل منها يحتوي على ثمانية وحدات معالجة رسومات A100-80GB في مرحلتين: تدريب غير متصل على البيانات المُحاكاة، يليه تحسين دقيق للبث على مزيج من الصوت الحقيقي والمحاكى. يُحكم على استخدام النموذج باتفاقية ترخيص OpenMDW، الإصدار 1.1.
إعدادات خدمة Baseten والسعة
تُظهر Baseten النموذج عبر ثلاث إعدادات مسبقة، كل منها يعمل على بطاقة RTX PRO 6000 واحدة خلف محرك رسومي CUDA‑graph مبني حول حلقة البث الخاصة بـ NVIDIA NeMo، وفقًا قائمة مكتبة النماذج الخاصة به، التي تصف النموذج أيضًا بأنه الخلف لسلسلة Streaming Sortformer v2.1. إعداد Batch Diarization هو نقطة نهاية HTTP للصوت المسجل تُعيد فترات المتحدثين مع ملف تعريف زمن الاستجابة لكل طلب. أما Streaming Diarization فهو نقطة نهاية WebSocket للصوت المباشر تنقل هوية المتحدث عبر المحادثة دون إعادة تجميع. يجمع Streaming Diarized Transcription بين أداة التمييز الصوتي ونموذج التعرف على الكلام Parakeet V2 من NVIDIA، وهو نظام يضم 600 مليون معلمة، ويُعيد الكلمات الموسومة بالمتحدث مع توقيتاتها، والجزء الجزئي لكل متحدث، وعلامات التداخل. تقول Baseten إن هذا الإعداد يرسل متجهات نشاط المتحدث مباشرة إلى طبقات الترميز الأولية في Parakeet بحيث يُنقَل الكلام المتداخل في تمريرة واحدة، وتصبح تسميات المتحدث نهائية عند الوصول ولا تُعدَّل الكلمات الملتزم بها.
تشير Baseten إلى أن بطاقة RTX PRO 6000 واحدة يمكنها الحفاظ على أكثر من 500 تدفق تمييز صوتي متزامن لمدة ساعة عند ملف تعريف 1.04 ثانية، و200 تدفق عند ملف تعريف 0.32 ثانية، و190 تدفقًا لمدة ساعة عندما تُضاف عملية النسخ، بينما يعالج إعداد الدفعة 200 ملف صوتي مدته ست دقائق في كل دقيقة. باستخدام ملفات ومعدات متماثلة، تقرّب Baseten أن إعدادها المُحسّن قد حقق تقريبًا 1.35 مرة أعلى من معدل الإنتاجية للدفعات مقارنةً بإعداد NVIDIA المرجعي الذي اختُبر، تحت حمل مُولَّد بواسطة k6 داخل العنقود مع تحكم تدفق واحد على نسخة خاملة.
تضيف Baseten أن إشارة نشاط المتحدث لكل متحدث، التي تُتبع بفواصل زمنية قدرها 10 مللي ثانية، يمكنها تشغيل كشف النشاط الصوتي، واكتشاف نهاية دور المتحدث، وإدارة تبادل الأدوار والتقاطعات، مستجيبةً في حوالي 300 مللي ثانية في إعدادات زمن استجابة منخفضة للغاية.
يتوفر Nemotron 3 Diarization على منصة Hugging Face ضمن المستودع nvidia/Nemotron-3-Diarization وفي مكتبة النماذج الخاصة بـ Baseten، مع تكامل إطار عمل NeMo v3.0 ودعم لمعالجات الرسوميات NVIDIA Ampere وAda Lovelace وHopper وBlackwell.












