AI-modellen en platforms

NVIDIA brengt Nemotron 3 Diarization Open-Weight sprekermodel uit

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

NVIDIA heeft op 23 september 2026 Nemotron 3 Diarization uitgebracht, een open-weight sprekerdiarisatiemodel dat tot acht sprekers kan identificeren in live- of opgenomen audio, en Baseten kondigde dezelfde‑dag serving‑ondersteuning aan met batch-, streaming- en diarized‑transcription‑presets die elk op één RTX PRO 6000‑GPU draaien.

Sprekerdiarisatie segmenteert een audiostream op basis van wanneer elke afzonderlijke spreker praat, geeft tijdstempels voor elke stem weer en kent elke span een consistente label toe; in combinatie met transcriptie wijst het getranscribeerde woorden toe aan de persoon die ze heeft uitgesproken. Baseten’s aankondiging beschrijft Nemotron 3 Diarization als een open, end‑to‑end model dat de gebruikelijke segmentatie‑plus‑embedding‑pipeline en de afstemming ervan vervangt door één enkele doorgang, waarbij sprekers worden gelabeld met een configureerbaar interval van maar liefst elke 320 milliseconden.

Architectuur en latentieprofielen

Volgens NVIDIA’s modelkaart is het model ontworpen om te bepalen \”wie sprak wanneer\” in audio uit de echte wereld, ondersteunt zowel streaming‑ als offline‑inference, en is klaar voor commercieel of niet‑commercieel gebruik. Het is een 100‑miljoen‑parameter, 31‑laag Transformer‑encoder met Rotary Positional Embeddings. Inkomende 16 kHz mono‑audio wordt omgezet in 10‑milliseconden mel‑spectrogram‑frames, met een factor acht naar beneden gesampled tot een encoder‑frame‑rate van 80 milliseconden, en een Conv1D‑laag boven de encoder schaalt de voorspellingen weer omhoog naar de 10‑milliseconden invoerresolutie. Het model levert een tensor met per‑spreker activiteits‑kansen met de vorm T, 8, en de acht sprekerkanalen worden geordend op basis van de eerste aankomst van elke spreker in de audio.

Voor streaming gebruikt het model de Arrival‑Order Speaker Cache en FIFO‑queue die geïntroduceerd werden in NVIDIA’s Streaming Sortformer‑werk: de cache behoudt sprekerinformatie van eerdere chunks zodat de eerste gehoorde stem zijn label behoudt, terwijl de queue recente frame‑context biedt voor elke verwerkingsstap. Het ontwerp vereist geen embeddings of clustering, en chunked inference stelt geen vaste limiet aan de audioduur.

Een enkel checkpoint biedt vier aanbevolen latentie‑configuraties: 0,32, 0,64 en 1,04 seconden, plus een offline‑stijl 30,4‑seconden invoerbuffer. De kaart definieert deze latentie als invoerbuffer‑latentie — chunk‑lengte plus rechter context, vermenigvuldigd met 80 milliseconden — en merkt op dat het cijfer de computationele verwerkingstijd uitsluit. Het checkpoint kan draaien met een buffer zo laag als 80 milliseconden, hoewel 0,32 seconden de laagste aanbevolen configuratie is, en de resolutie van de output‑frames is configureerbaar in veelvouden van 10 milliseconden.

Gerapporteerde nauwkeurigheid en snelheid

NVIDIA’s modelkaart rapporteert diarization‑foutpercentage, spreker‑teller‑nauwkeurigheid en spreker‑teller‑gemiddelde absolute fout ten opzichte van de diar_streaming_sortformer_4spk-v2.1 baseline, met overlappende spraak inbegrepen en een nul‑seconden collar op elke benchmark behalve CALLHOME-Part2, die een 0,25‑seconden collar gebruikt. Op DIHARD III rapporteert de kaart een volledige set foutpercentage van 12,73 bij het 30,4‑seconden profiel en 13,55 bij 0,32 seconden, versus 19,09 en 19,85 voor de baseline. Op NOTSOFAR1 single‑channel opnamen meldt hij 11,00 versus 30,49 bij het offline profiel; op AMI Test SDM, 11,14 versus 21,42; op AliMeeting Test Near, 6,40 versus 11,57; en op CALLHOME‑Part2, 9,10 versus 10,32. De kaart stelt dat zijn AMI-, AliMeeting- en NOTSOFAR1‑scores zijn berekend met forced‑alignment referentielabels en dat resultaten die zijn gescoord tegen verschillende referentie‑annotaties niet direct vergelijkbaar zijn.

Een snelheids‑tabel in de kaart rapporteert real‑time‑factor versnelling, gedefinieerd als totale audioduur gedeeld door totale verwerkingstijd, van 1.340 in eager‑modus en 4.385 gecompileerd bij batch‑grootte één op het offline profiel, gemeten op een RTX PRO 5000 met BF16‑precisie. Bij het 0,32‑seconden profiel zijn de overeenkomstige cijfers 12,5 en 54.

Baseten voerde zijn eigen evaluatie uit, waarbij ook het foutpercentage werd gemeten met overlappende spraak inbegrepen en zonder collar. Het meldt een foutpercentage van 9,8 % op AISHELL-4 bij het low‑latency profiel tegenover 27,2 % voor Streaming Sortformer v2.1, en stelt dat het verplaatsen van het 30‑seconden offline profiel naar het 0,32‑seconden ultra‑low profiel het foutpercentage slechts met één tot twee punten verhoogt. Baseten meldt dat het model Meta Muse Voice Transcribe op elk dataset dat het testte overtrof, zelfs in de ultra‑low configuratie, en alleen verloor van pyannote community-1 op AMI.

Trainingsgegevens en licentiëring

De modelkaart vermeldt ongeveer 10.000 uur aan echte gesprekken (inclusief Fisher English, de AMI‑ en ICSI‑meeting‑corpora, VoxConverse, AISHELL-4, AliMeeting, de derde DIHARD‑challenge, CALLHOME, NOTSOFAR1, de DISPLACE‑sets, gelicentieerde David AI‑opnamen, en een pseudo‑gelabelde YODAS‑v2‑subset) naast 82.611 uur aan multi‑speaker mengsels gesimuleerd met de FastMSS‑toolkit van ongeveer 28.000 uur aan single‑speaker opnamen. De training werd geïnitieerd vanuit een NEST self‑supervised checkpoint en uitgevoerd op acht knooppunten van acht A100‑80GB‑GPU’s in twee fasen: offline training op gesimuleerde data, gevolgd door streaming fine‑tuning op een combinatie van echte en gesimuleerde audio. Het gebruik van het model wordt beheerst door de OpenMDW License Agreement, versie 1.1.

Baseten serving‑presets en capaciteit

Baseten maakt het model beschikbaar via drie presets, die elk draaien op één RTX PRO 6000 achter een CUDA-graph engine die is opgebouwd rond de streaming‑loop van NVIDIA’s NeMo, volgens de vermelding in de Model Library, die het model ook beschrijft als de opvolger van Streaming Sortformer v2.1. De Batch Diarization‑preset is een HTTP‑endpoint voor opgenomen audio dat sprekerswisselingen teruggeeft met een latency‑profiel per aanvraag. Streaming Diarization is een WebSocket‑endpoint voor live‑audio dat sprekeridentiteit door een gesprek heen draagt zonder opnieuw te clusteren. Streaming Diarized Transcription koppelt de diarizer aan NVIDIA’s Parakeet V2 spraakherkenningsmodel, een systeem met 600 miljoen parameters, en levert sprekertagged woorden met tijdstempels, per‑spreker‑partials en overlap‑vlaggen. Baseten zegt dat deze preset per‑spreker‑activiteitsvectoren direct in de eerste encoderlagen van Parakeet injecteert, zodat overlappende spraak in één doorgang wordt getranscribeerd, met sprekerlabels definitief bij aankomst en toegezegde woorden nooit worden aangepast.

Baseten meldt dat één RTX PRO 6000 meer dan 500 gelijktijdige diarizatiestromen van een uur kan onderhouden bij het 1,04‑seconden‑profiel, 200 streams bij het 0,32‑seconden‑profiel, en 190 uur‑lange streams wanneer transcriptie wordt toegevoegd, terwijl de batch‑preset 200 audio‑bestanden van zes minuten per minuut verwerkt. Met identieke bestanden en hardware meldt Baseten dat zijn geoptimaliseerde preset ongeveer 1,35 keer hogere batch‑doorvoer leverde dan de NVIDIA‑referentieset‑up die hij testte, onder k6‑gegenereerde belasting binnen de cluster met een één‑stream‑controle op een inactieve replica.

Baseten zegt ook dat het per‑spreker‑activiteitssignaal van het model, bijgehouden in stappen van 10 milliseconden, stemactiviteitsdetectie, spreker‑specifieke einde‑van‑turn‑detectie en beurt‑en‑onderbrekingsbeheer kan aansturen, met een respons van ongeveer 300 milliseconden bij ultra‑lage‑latency‑instellingen.

Nemotron 3 Diarization is beschikbaar op Hugging Face onder de repository nvidia/Nemotron-3-Diarization en in Baseten’s Model Library, met integratie van NeMo Framework v3.0 en ondersteuning voor NVIDIA Ampere-, Ada Lovelace-, Hopper- en Blackwell‑GPU’s.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.