Modele și platforme AI
NVIDIA lansează modelul de vorbitor cu greutăţi deschise Nemotron 3 Diarization

NVIDIA a lansat pe 23 septembrie 2026 Nemotron 3 Diarization, un model de diarizare a vorbitorilor cu greutăţi deschise care identifică până la opt vorbitori în audio live sau înregistrat, iar Baseten a anunțat suport de servire în aceeaşi zi cu presetări pentru batch, streaming şi transcriere diarizată, fiecare rulând pe o singură placă RTX PRO 6000 GPU.
Diarizarea vorbitorilor segmentează un flux audio în funcţie de momentul în care fiecare vorbitor distinct vorbeşte, furnizează timpi pentru fiecare voce şi atribuie fiecărui segment o etichetă consistentă; asociată cu transcrierea, atribuie cuvintele transcrise persoanei care le-a rostit. anunțul Baseten descrie Nemotron 3 Diarization ca un model deschis, end-to-end, care înlocuieşte pipeline‑ul obişnuit de segmentare‑plus‑încărcare şi reglarea acestuia cu o singură trecere, etichetând vorbitorii la un interval configurabil de până la 320 de milisecunde.
Arhitectură şi profiluri de latență
Conform fișei modelului NVIDIA, modelul este conceput pentru a determina \”cine a vorbit când\” în audio din lumea reală, suportă atât inferenţă streaming, cât şi offline şi este pregătit pentru utilizare comercială sau non‑comercială. Este un codor Transformer cu 100 de milioane de parametri, 31 de straturi, cu încorporări poziţionale rotative. Audio‑ul de intrare, monofonic la 16 kHz, este convertit în cadre de mel‑spectrogramă de 10 milisecunde, redus cu un factor de opt la o rată de cadre a codorului de 80 milisecunde, iar un strat Conv1D deasupra codorului reconstruieste predicţiile la rezoluţia de intrare de 10 milisecunde. Modelul emite un tensor cu probabilităţile de activitate per vorbitor având forma T, 8, iar cele opt canale de vorbitor sunt ordonate în funcţie de prima apariţie a fiecărui vorbitor în audio.
Pentru streaming, modelul foloseşte Cache‑ul Vorbitorilor pe Ordine de Sosire şi coada FIFO introdusă în lucrarea Streaming Sortformer a NVIDIA: cache‑ul păstrează informaţiile despre vorbitori din segmentele anterioare astfel încât prima voce auzită îşi păstrează eticheta, în timp ce coada furnizează contextul recent al cadrelor pentru fiecare pas de procesare. Designul nu necesită încorporări sau grupare, iar inferenţa pe segmente nu impune nicio limită fixă asupra duratei audio.
Un singur punct de control serveşte patru configuraţii de latență recomandate: 0.32, 0.64 şi 1.04 secunde, plus un buffer de intrare de 30.4 secunde în stil offline. Fișa defineşte această latență ca latenţă a buffer‑ului de intrare — lungimea segmentului plus contextul din dreapta, înmulţită cu 80 milisecunde — şi menţionează că valoarea exclude timpul de procesare computaţională. Punctul de control poate rula cu un buffer de doar 80 milisecunde, deşi 0.32 secunde este cea mai mică configuraţie recomandată, iar rezoluţia cadrelor de ieşire este configurabilă în multipli de 10 milisecunde.
Acurateţe şi viteză raportate
Fișa modelului NVIDIA raportează rata de eroare a diarizării, acurateţea numărării vorbitorilor şi eroarea medie absolută a numărării vorbitorilor faţă de diar_streaming_sortformer_4spk-v2.1 referinţă, cu vorbire suprapusă inclusă şi o margine de zero secunde pentru fiecare benchmark, cu excepţia CALLHOME-Part2, care foloseşte o margine de 0.25 secunde. Pe DIHARD III, fișa raportează o rată de eroare a setului complet de 12.73 la profilul de 30.4 secunde şi 13.55 la 0.32 secunde, comparativ cu 19.09 şi 19.85 pentru referinţă. Pentru înregistrările monofonice NOTSOFAR1 raportează 11.00 versus 30.49 la profilul offline; pe AMI Test SDM, 11.14 versus 21.42; pe AliMeeting Test Near, 6.40 versus 11.57; şi pe CALLHOME-Part2, 9.10 versus 10.32. Fișa afirmă că scorurile sale pentru AMI, AliMeeting şi NOTSOFAR1 au fost calculate cu etichete de referinţă prin aliniere forţată şi că rezultatele evaluate faţă de diferite adnotări de referinţă nu sunt direct comparabile.
Un tabel de viteză din fișă raportează o accelerare în factor real‑timp, definită ca durata totală a audio‑ului împărţită la timpul total de procesare, de 1,340 în modul eager şi 4,385 compilat la dimensiunea de batch unu pe profilul offline, măsurat pe un RTX PRO 5000 la precizia BF16. La profilul de 0.32 secunde, valorile corespunzătoare sunt 12.5 şi 54.
Baseten a realizat propria evaluare, scorând tot rata de eroare cu vorbire suprapusă inclusă şi fără margine. Raportează o rată de eroare de 9.8% pe AISHELL-4 la profilul de latență scăzută, comparativ cu 27.2% pentru Streaming Sortformer v2.1, şi afirmă că trecerea de la profilul offline de 30 de secunde la profilul ultra‑scăzut de 0.32 secunde creşte rata de eroare cu doar unu‑două puncte. Baseten raportează că modelul a depășit Meta Muse Voice Transcribe pe fiecare set de date testat, chiar şi la configuraţia ultra‑scăzută, şi a pierdut în faţa pyannote community‑1 doar pe AMI.
Date de antrenament şi licențiere
Fișa modelului enumeră aproximativ 10,000 de ore de conversaţii reale (inclusiv Fisher English, corpurile de întâlniri AMI şi ICSI, VoxConverse, AISHELL-4, AliMeeting, a treia provocare DIHARD, CALLHOME, NOTSOFAR1, seturile DISPLACE, înregistrări licenţiate David AI şi un subset pseudo‑etichetat YODAS‑v2) alături de 82,611 ore de amestecuri multi‑vorbitor simulate cu toolkit‑ul FastMSS din aproximativ 28,000 de ore de înregistrări monofonice. Antrenamentul a pornit de la un punct de control auto‑supervizat NEST şi a rulat pe opt noduri, fiecare cu opt GPU‑uri A100‑80GB, în două etape: antrenament offline pe date simulate, urmat de fine‑tuning streaming pe o combinaţie de audio real şi simulat. Utilizarea modelului este guvernată de OpenMDW License Agreement, versiunea 1.1.
Presetări de servire Baseten şi capacitate
Baseten expune modelul prin trei presetări, fiecare rulând pe un RTX PRO 6000 în spatele unui motor CUDA‑graph construit în jurul buclei de streaming NeMo de la NVIDIA, conform listării sale din Biblioteca de modele, care descrie, de asemenea, modelul ca succesor al Streaming Sortformer v2.1. Presetarea Batch Diarization este un punct final HTTP pentru audio înregistrat care returnează schimbările de vorbitor cu un profil de latență per cerere. Streaming Diarization este un punct final WebSocket pentru audio în timp real care transportă identitatea vorbitorului pe parcursul unei conversații fără regrupare. Streaming Diarized Transcription asociază diarizatorul cu modelul de recunoaștere vocală Parakeet V2 de la NVIDIA, un sistem de 600 de milioane de parametri, și returnează cuvinte etichetate pe vorbitori cu marcaje temporale, fragmente per vorbitor și indicatoare de suprapunere. Baseten afirmă că această presetare alimentează vectorii de activitate per vorbitor direct în straturile inițiale ale encoder‑ului Parakeet, astfel încât vorbirea suprapusă este transcrisă într‑un singur pas, cu etichetele vorbitorului finalizate la sosire și cuvintele confirmate niciodată revizuite.
Baseten raportează că un RTX PRO 6000 susține peste 500 de fluxuri concurente de diarizare de o oră la profilul de 1,04 secunde, 200 de fluxuri la profilul de 0,32 secunde și 190 de fluxuri de o oră când se adaugă transcrierea, în timp ce presetarea batch procesează 200 de fișiere audio de șase minute pe minut. Folosind fișiere și hardware identice, Baseten raportează că presetarea sa optimizată a livrat aproximativ 1,35 ori o rată de procesare batch mai mare decât configurația de referință NVIDIA testată, sub sarcină generată de k6 în interiorul clusterului cu un control de un flux pe o replică inactivă.
Baseten mai spune că semnalul de activitate per vorbitor al modelului, urmărit în incrementări de 10 milisecunde, poate conduce la detectarea activității vocale, la detectarea sfârșitului de intervenție specifică vorbitorului și la gestionarea luării de cuvânt și a întreruperilor, răspunzând în aproximativ 300 milisecunde în setările de latență ultra‑scăzută.
Nemotron 3 Diarization este disponibil pe Hugging Face în cadrul depozitului nvidia/Nemotron-3-Diarization și în Biblioteca de modele Baseten, cu integrare NeMo Framework v3.0 și suport pentru GPU‑urile NVIDIA Ampere, Ada Lovelace, Hopper și Blackwell.












