एआई मॉडल और प्लेटफ़ॉर्म
NVIDIA ने Nemotron 3 Diarization, एक ओपन‑वेट स्पीकर मॉडल, जारी किया

NVIDIA ने 23 सितंबर, 2026 को Nemotron 3 Diarization जारी किया, एक ओपन‑वेट स्पीकर डायराइज़ेशन मॉडल जो लाइव या रिकॉर्डेड ऑडियो में अधिकतम आठ वक्ताओं की पहचान करता है, और Baseten ने उसी दिन बैच, स्ट्रीमिंग, और डायराइज़्ड‑ट्रांसक्रिप्शन प्रीसेट्स के साथ सर्विंग समर्थन की घोषणा की, जो प्रत्येक एक RTX PRO 6000 GPU पर चलते हैं।
स्पीकर डायराइज़ेशन ऑडियो स्ट्रीम को प्रत्येक अलग‑अलग वक्ता के बोलने के समय के आधार पर विभाजित करता है, प्रत्येक आवाज़ के समय‑संकेत प्रदान करता है, और प्रत्येक भाग को एक सुसंगत लेबल सौंपता है; ट्रांसक्रिप्शन के साथ मिलाकर, यह ट्रांसक्राइब किए गए शब्दों को उस व्यक्ति से जोड़ता है जिसने उन्हें कहा। Baseten की घोषणा Nemotron 3 Diarization को एक ओपन, एंड‑टू‑एंड मॉडल के रूप में वर्णित करती है जो सामान्य सेगमेंटेशन‑प्लस‑एम्बेडिंग पाइपलाइन और उसकी ट्यूनिंग को एक ही पास में बदल देता है, और वक्ताओं को न्यूनतम 320 मिलीसेकंड के कॉन्फ़िगरेबल अंतराल पर लेबल करता है।
आर्किटेक्चर और लेटेंसी प्रोफ़ाइल
NVIDIA का मॉडल कार्ड के अनुसार, मॉडल को वास्तविक‑दुनिया के ऑडियो में “कौन कब बोला” निर्धारित करने के लिए डिज़ाइन किया गया है, यह स्ट्रीमिंग और ऑफ़लाइन दोनों इन्फ़रेंस का समर्थन करता है, और व्यावसायिक या गैर‑व्यावसायिक उपयोग के लिए तैयार है। यह 100 मिलियन पैरामीटर, 31‑लेयर ट्रांसफ़ॉर्मर एन्कोडर है जिसमें रोटरी पोज़िशनल एम्बेडिंग्स हैं। इनकमिंग 16 kHz सिंगल‑चैनल ऑडियो को 10 मिलीसेकंड के मेल‑स्पेक्ट्रोग्राम फ्रेम में बदला जाता है, जिसे आठ गुना डाउनसैंपल करके 80 मिलीसेकंड एन्कोडर फ्रेम रेट पर लाया जाता है, और एन्कोडर के ऊपर का Conv1D लेयर भविष्यवाणियों को फिर से 10 मिलीसेकंड इनपुट रिज़ॉल्यूशन पर अपसैंपल करता है। मॉडल एक टेन्सर आउटपुट करता है जिसमें प्रत्येक स्पीकर की एक्टिविटी प्रॉबेबिलिटी T × 8 आकार की होती है, और उसके आठ स्पीकर चैनल ऑडियो में प्रत्येक स्पीकर की पहली उपस्थिति के क्रम में व्यवस्थित होते हैं।
स्ट्रीमिंग के लिए, मॉडल NVIDIA के Streaming Sortformer कार्य में प्रस्तुत Arrival-Order Speaker Cache और FIFO कतार का उपयोग करता है: कैश पहले के चंक्स से स्पीकर जानकारी को रखता है ताकि पहली आवाज़ को उसका लेबल बना रहे, जबकि कतार प्रत्येक प्रोसेसिंग चरण के लिए हालिया फ्रेम संदर्भ प्रदान करती है। इस डिज़ाइन को किसी एम्बेडिंग या क्लस्टरिंग की आवश्यकता नहीं होती, और चंक्स‑आधारित इन्फ़रेंस ऑडियो अवधि पर कोई स्थिर सीमा नहीं लगाता।
एकल चेकपॉइंट चार अनुशंसित लेटेंसी कॉन्फ़िगरेशन को सपोर्ट करता है: 0.32, 0.64 और 1.04 सेकंड, साथ ही एक ऑफ़लाइन‑स्टाइल 30.4‑सेकंड इनपुट बफ़र। कार्ड इस लेटेंसी को इनपुट बफ़र लेटेंसी — चंक लंबाई प्लस राइट कॉन्टेक्स्ट, जिसे 80 मिलीसेकंड से गुणा किया जाता है — के रूप में परिभाषित करता है और बताता है कि यह आंकड़ा गणनात्मक प्रोसेसिंग समय को बाहर रखता है। चेकपॉइंट 80 मिलीसेकंड के न्यूनतम बफ़र के साथ चल सकता है, हालांकि 0.32 सेकंड सबसे कम अनुशंसित कॉन्फ़िगरेशन है, और आउटपुट फ्रेम रिज़ॉल्यूशन 10 मिलीसेकंड के गुणकों में कॉन्फ़िगर किया जा सकता है।
रिपोर्टेड सटीकता और गति
NVIDIA के मॉडल कार्ड में डायराइज़ेशन त्रुटि दर, स्पीकर काउंटिंग सटीकता, और स्पीकर काउंटिंग औसत निरपेक्ष त्रुटि को बेसलाइन के खिलाफ रिपोर्ट किया गया है। diar_streaming_sortformer_4spk-v2.1 बेसलाइन, जिसमें ओवरलैपिंग स्पीच शामिल है और प्रत्येक बेंचमार्क पर शून्य‑सेकंड कॉलर लागू किया गया है, सिवाय CALLHOME-Part2 के, जो 0.25‑सेकंड कॉलर उपयोग करता है। DIHARD III पर, कार्ड 30.4‑सेकंड प्रोफ़ाइल पर 12.73 की फुल‑सेट त्रुटि दर और 0.32 सेकंड पर 13.55 की रिपोर्ट करता है, जबकि बेसलाइन के लिए क्रमशः 19.09 और 19.85 हैं। NOTSOFAR1 सिंगल‑चैनल रिकॉर्डिंग्स पर यह ऑफ़लाइन प्रोफ़ाइल में 11.00 बनाम 30.49 रिपोर्ट करता है; AMI Test SDM पर 11.14 बनाम 21.42; AliMeeting Test Near पर 6.40 बनाम 11.57; और CALLHOME-Part2 पर 9.10 बनाम 10.32। कार्ड बताता है कि उसके AMI, AliMeeting, और NOTSOFAR1 स्कोर फोर्स्ड‑अलाइनमेंट रेफ़रेंस लेबल्स के साथ गणना किए गए थे और विभिन्न रेफ़रेंस एनोटेशन्स के विरुद्ध स्कोर किए गए परिणाम सीधे तुलना योग्य नहीं हैं।
कार्ड में एक स्पीड टेबल वास्तविक‑समय‑फ़ैक्टर स्पीडअप को दर्शाती है, जिसे कुल ऑडियो अवधि को कुल प्रोसेसिंग समय से विभाजित करके परिभाषित किया गया है, जो ईगर मोड में 1,340 और ऑफ़लाइन प्रोफ़ाइल पर बैच साइज एक के साथ 4,385 है, और इसे RTX PRO 5000 पर BF16 प्रिसीजन के साथ मापा गया। 0.32‑सेकंड प्रोफ़ाइल पर, संबंधित आंकड़े क्रमशः 12.5 और 54 हैं।
Baseten ने अपना स्वयं का मूल्यांकन किया, जिसमें ओवरलैपिंग स्पीच शामिल था और कोई कॉलर नहीं था। यह कम लेटेंसी प्रोफ़ाइल पर AISHELL-4 पर 9.8 प्रतिशत त्रुटि दर रिपोर्ट करता है, जबकि Streaming Sortformer v2.1 के लिए 27.2 प्रतिशत है, और बताता है कि 30‑सेकंड ऑफ़लाइन प्रोफ़ाइल से 0.32‑सेकंड अल्ट्रा‑लो प्रोफ़ाइल में जाने से त्रुटि दर केवल एक‑से‑दो अंक बढ़ती है। Baseten रिपोर्ट करता है कि मॉडल ने Meta Muse Voice Transcribe को सभी परीक्षण किए गए डेटासेट्स पर, यहाँ तक कि अल्ट्रा‑लो कॉन्फ़िगरेशन में भी, पीछे छोड़ दिया, और केवल AMI पर pyannote community-1 से हार गया।
प्रशिक्षण डेटा और लाइसेंसिंग
मॉडल कार्ड में लगभग 10,000 घंटे के वास्तविक वार्तालापों की सूची है (जिसमें Fisher English, AMI और ICSI मीटिंग कॉर्पोरा, VoxConverse, AISHELL-4, AliMeeting, तीसरा DIHARD चुनौती, CALLHOME, NOTSOFAR1, DISPLACE सेट, लाइसेंस्ड David AI रिकॉर्डिंग्स, और एक स्यूडो‑लेबल्ड YODAS‑v2 उपसमुच्चय शामिल हैं) के साथ-साथ 82,611 घंटे के मल्टी‑टॉकर मिश्रण जो FastMSS टूलकिट का उपयोग करके लगभग 28,000 घंटे की सिंगल‑स्पीकर रिकॉर्डिंग्स से सिम्युलेट किए गए हैं। प्रशिक्षण NEST सेल्फ‑सुपरवाइज़्ड चेकपॉइंट से प्रारंभ हुआ और दो चरणों में आठ नोड्स, प्रत्येक पर आठ A100‑80GB GPU के साथ चलाया गया: सिम्युलेटेड डेटा पर ऑफ़लाइन प्रशिक्षण, उसके बाद वास्तविक और सिम्युलेटेड ऑडियो के संयोजन पर स्ट्रीमिंग फाइन‑ट्यूनिंग। मॉडल का उपयोग OpenMDW लाइसेंस एग्रीमेंट, संस्करण 1.1 द्वारा नियंत्रित है।
Baseten सर्विंग प्रीसेट्स और क्षमता
Baseten मॉडल को तीन प्रीसेट्स के माध्यम से उजागर करता है, प्रत्येक एक RTX PRO 6000 पर चल रहा है, जो NVIDIA के NeMo स्ट्रीमिंग लूप के आसपास निर्मित CUDA-graph इंजन के पीछे है, के अनुसार उसकी मॉडल लाइब्रेरी सूची, जो मॉडल को Streaming Sortformer v2.1 का उत्तराधिकारी बताती है। Batch Diarization प्रीसेट रिकॉर्ड किए गए ऑडियो के लिए एक HTTP एंडपॉइंट है जो प्रति‑अनुरोध लेटेंसी प्रोफ़ाइल के साथ स्पीकर टर्न लौटाता है। Streaming Diarization लाइव ऑडियो के लिए एक WebSocket एंडपॉइंट है जो बातचीत के दौरान स्पीकर पहचान को पुनः‑क्लस्टरिंग के बिना ले जाता है। Streaming Diarized Transcription डायराइज़र को NVIDIA के Parakeet V2 स्पीच रिकग्निशन मॉडल, एक 600‑मिलियन‑पैरामीटर सिस्टम, के साथ जोड़ता है और टाइमिंग्स, प्रति‑स्पीकर पार्टियल्स और ओवरलैप फ़्लैग्स के साथ स्पीकर‑टैग्ड शब्द लौटाता है। Baseten कहता है कि यह प्रीसेट प्रति‑स्पीकर एक्टिविटी वेक्टर को सीधे Parakeet की प्रारंभिक एन्कोडर लेयर्स में फीड करता है ताकि ओवरलैप्ड स्पीच एक ही पास में ट्रांसक्राइब हो, स्पीकर लेबल्स आगमन पर अंतिम होते हैं और कमिटेड शब्द कभी संशोधित नहीं होते।
Baseten रिपोर्ट करता है कि एक RTX PRO 6000 1.04‑सेकंड प्रोफ़ाइल पर 500 से अधिक समकालिक एक‑घंटे‑लंबी डायराइज़ेशन स्ट्रीम्स, 0.32‑सेकंड प्रोफ़ाइल पर 200 स्ट्रीम्स, और ट्रांसक्रिप्शन जोड़ने पर 190 एक‑घंटे‑लंबी स्ट्रीम्स को बनाए रखता है, जबकि बैच प्रीसेट प्रति मिनट 200 छह‑मिनट के ऑडियो फ़ाइलों को प्रोसेस करता है। समान फ़ाइलों और हार्डवेयर का उपयोग करते हुए, Baseten रिपोर्ट करता है कि उसका अनुकूलित प्रीसेट परीक्षण किए गए NVIDIA रेफ़रेंस सेटअप की तुलना में लगभग 1.35 गुना अधिक बैच थ्रूपुट प्रदान करता है, k6‑जनित लोड के तहत क्लस्टर के भीतर एक‑स्ट्रीम कंट्रोल के साथ एक निष्क्रिय रेप्लिका पर।
Baseten यह भी कहता है कि मॉडल का प्रति‑स्पीकर एक्टिविटी सिग्नल, जो 10‑मिलीसेकंड अंतराल में ट्रैक किया जाता है, वॉइस एक्टिविटी डिटेक्शन, स्पीकर‑विशिष्ट टर्न‑एंड डिटेक्शन, तथा टर्न‑टेकिन्ग और इंटरप्शन हैंडलिंग को संचालित कर सकता है, और अल्ट्रा‑लो लेटेंसी सेटिंग्स पर लगभग 300 मिलीसेकंड में प्रतिक्रिया देता है।
Nemotron 3 Diarization Hugging Face पर रिपॉजिटरी nvidia/Nemotron-3-Diarization के तहत और Baseten की Model Library में उपलब्ध है, जिसमें NeMo Framework v3.0 इंटीग्रेशन और NVIDIA Ampere, Ada Lovelace, Hopper, तथा Blackwell GPUs के लिए समर्थन शामिल है।












