AI-modeller och plattformar
NVIDIA lanserar Nemotron 3 Diarization Open-Weight talarmodell

NVIDIA släppte den 23 september 2026 Nemotron 3 Diarization, en open-weight talardiariseringsmodell som identifierar upp till åtta talare i live‑ eller inspelat ljud, och Baseten meddelade stöd för servering samma dag med batch‑, streaming‑ och diariserad‑transkriptions‑presetar som alla körs på ett RTX PRO 6000‑GPU.
Talardiarisering segmenterar en ljudström efter när varje distinkt talare pratar, ger ut tidsstämplar för varje röst och tilldelar varje segment en konsekvent etikett; i kombination med transkription attribuerar den transkriberade ord till den person som uttalade dem. Basetens tillkännagivande beskriver Nemotron 3 Diarization som en öppen, end‑to‑end‑modell som ersätter den vanliga segmentering‑plus‑inbäddningspipeline och dess finjustering med ett enda pass, och märker talare med ett konfigurerbart intervall så lågt som var 320 millisekund.
Arkitektur och latensprofiler
Enligt NVIDIAs modellkort är modellen utformad för att avgöra ”vem som talade när” i verkligt ljud, stödjer både streaming‑ och offline‑inferens och är klar för kommersiell eller icke‑kommersiell användning. Den är en 100‑miljon‑parameter, 31‑lagers Transformer‑kodare med roterande positionsinbäddningar. Inkommande 16 kHz enkelkanaligt ljud omvandlas till 10 millisekunders mel‑spektrum‑ramar, nedsamplas med en faktor åtta till en 80 millisekunders kodarrate, och ett Conv1D‑lager ovanför kodaren uppsamplar prediktionerna tillbaka till 10 millisekunders ingångsupplösning. Modellen producerar en tensor med sannolikheter för talaraktivitet per talare med formen T × 8, och dess åtta talarkanaler är ordnade efter varje talares första ankomst i ljudet.
För streaming använder modellen Arrival‑Order Speaker Cache och FIFO‑kö som introducerades i NVIDIAs Streaming Sortformer‑arbete: cachen behåller talarinformation från tidigare segment så att den första hörda rösten behåller sin etikett, medan kön ger kontext från de senaste ramarna för varje bearbetningssteg. Designen kräver inga inbäddningar eller klustring, och segmenterad inferens sätter ingen fast gräns för ljudets varaktighet.
En enda checkpoint betjänar fyra rekommenderade latenskonfigurationer: 0.32, 0.64 och 1.04 sekunder, samt en offline‑liknande 30.4‑sekunders inmatningsbuffert. Kortet definierar denna latens som inmatningsbuffert‑latens — segmentlängd plus högerram, multiplicerat med 80 millisekunder — och noterar att siffran exkluderar beräknings‑processningstid. Checkpointen kan köras med en buffert så låg som 80 millisekunder, även om 0.32 sekunder är den lägsta rekommenderade konfigurationen, och utdata‑ramupplösning kan konfigureras i multiplar av 10 millisekunder.
Rapporterad noggrannhet och hastighet
NVIDIAs modellkort rapporterar diariseringsfelgrad, talarräkningens noggrannhet och talarräkningens medelabsoluta fel mot diar_streaming_sortformer_4spk-v2.1 baslinjen, med överlappande tal inkluderat och en nollsekunders marginal på varje benchmark förutom CALLHOME-Part2, som använder en 0.25‑sekunders marginal. På DIHARD III rapporterar kortet en full‑set felgrad på 12.73 för 30.4‑sekunders profilen och 13.55 för 0.32 sekunder, jämfört med 19.09 och 19.85 för baslinjen. På NOTSOFAR1‑inspelningar med en kanal rapporteras 11.00 kontra 30.49 för offline‑profilen; på AMI Test SDM, 11.14 kontra 21.42; på AliMeeting Test Near, 6.40 kontra 11.57; och på CALLHOME-Part2, 9.10 kontra 10.32. Kortet anger att dess AMI-, AliMeeting- och NOTSOFAR1‑resultat beräknades med forced‑alignment referensetiketter och att resultat som jämförs mot olika referensanoteringar inte är direkt jämförbara.
En hastighetstabell i kortet rapporterar real‑time‑factor‑accelerering, definierad som total ljudvaraktighet delat med total bearbetningstid, på 1,340 i eager‑läge och 4,385 kompilerad vid batch‑storlek ett på offline‑profilen, mätt på en RTX PRO 5000 med BF16‑precision. Vid 0.32‑sekunders profilen är motsvarande siffror 12.5 och 54.
Baseten genomförde sin egen utvärdering, där felgraden också beräknades med överlappande tal och utan marginal. De rapporterar en felgrad på 9.8 % på AISHELL‑4 vid den låga latensprofilen jämfört med 27.2 % för Streaming Sortformer v2.1, och säger att övergången från den 30‑sekunders offline‑profilen till den 0.32‑sekunders ultralåga profilen endast ökar felgraden med en till två procentenheter. Baseten rapporterar att modellen överträffade Meta Muse Voice Transcribe på varje dataset som testades, även i den ultralåga konfigurationen, och förlorade endast mot pyannote community‑1 på AMI.
Träningsdata och licensiering
Modellkortet listar ungefär 10 000 timmar av verkliga samtal (inklusive Fisher English, AMI‑ och ICSI‑möteskorpusar, VoxConverse, AISHELL‑4, AliMeeting, den tredje DIHARD‑utmaningen, CALLHOME, NOTSOFAR1, DISPLACE‑setten, licensierade David AI‑inspelningar och en pseudo‑etiketterad YODAS‑v2‑undermängd) tillsammans med 82 611 timmar av fler‑talare‑blandningar simulerade med FastMSS‑verktygssatsen från cirka 28 000 timmar av enkel‑talare‑inspelningar. Träningen initierades från en NEST‑självövervakad checkpoint och kördes på åtta noder med åtta A100‑80GB‑GPU:er i två steg: offline‑träning på simulerad data, följt av streaming‑finjustering på en kombination av verkligt och simulerat ljud. Användning av modellen styrs av OpenMDW License Agreement, version 1.1.
Baseten serverings‑presetar och kapacitet
Baseten exponerar modellen via tre förinställningar, var och en körs på en RTX PRO 6000 bakom en CUDA‑graph‑motor byggd kring NVIDIAs NeMo‑strömloop, enligt dess modellbibliotekslista, som också beskriver modellen som eftertraktaren till Streaming Sortformer v2.1. Batch‑diariserings‑förinställningen är en HTTP‑endpoint för inspelat ljud som returnerar talarturneringar med en per‑förfrågan latensprofil. Streaming‑diariserings‑förinställningen är en WebSocket‑endpoint för live‑ljud som bär talaridentitet genom en konversation utan om‑klustring. Streaming‑diariserad transkription parar ihop diarizern med NVIDIAs Parakeet V2‑taligenkänningsmodell, ett system med 600 miljoner parametrar, och returnerar talarmärkta ord med tidsstämplar, per‑talare partiella resultat och överlappningsflaggor. Baseten säger att denna förinställning matar in per‑talare aktivitetsvektorer direkt i Parakeets initiala kodarlager så att överlappande tal transkriberas i ett enda pass, med talarmärken som blir slutgiltiga vid ankomst och bekräftade ord som aldrig revideras.
Baseten rapporterar att en RTX PRO 6000 kan hantera mer än 500 samtidiga timlånga diariseringsströmmar med 1,04‑sekunders profilen, 200 strömmar med 0,32‑sekunders profilen och 190 timlånga strömmar när transkription läggs till, medan batch‑förinställningen bearbetar 200 sex‑minuters ljudfiler per minut. Med identiska filer och hårdvara rapporterar Baseten att deras optimerade förinställning levererade ungefär 1,35 gånger högre batch‑genomströmning än den NVIDIA‑referensuppsättning de testade, under k6‑genererad belastning i klustret med en‑ström‑kontroll på en overksam replika.
Baseten säger också att modellens per‑talare aktivitetsignal, spårad i 10‑millisekunders intervaller, kan driva röstaktivitetsdetektering, talarspecifik slut‑på‑turn‑detektering samt hantering av tur‑tagning och avbrott, och svarar på ungefär 300 millisekunder i ultra‑låglatensinställningar.
Nemotron 3 Diarization finns tillgänglig på Hugging Face under lagret nvidia/Nemotron-3-Diarization och i Basetens Model Library, med NeMo Framework v3.0‑integration och stöd för NVIDIA Ampere, Ada Lovelace, Hopper och Blackwell‑GPU:er.












