AI-modeller og plattformer
NVIDIA lanserer Nemotron 3 Diarization Open-Weight talermodell

NVIDIA publiserte den 23. september 2026 Nemotron 3 Diarization, en open-weight talerdiariseringmodell som identifiserer opptil åtte talere i live‑ eller opptatt lyd, og Baseten kunngjorde samme‑dag‑tjenestestøtte med batch‑, streaming‑ og diarized‑transcription‑presets som hver kjører på én RTX PRO 6000‑GPU.
Talerdiarisering segmenterer en lydstrøm etter når hver distinkte taler snakker, gir ut tidsstempler for hver stemme, og tildeler hvert segment en konsistent etikett; i kombinasjon med transkripsjon tilskrives transkriberte ord til personen som uttalte dem. Basetens kunngjøring beskriver Nemotron 3 Diarization som en åpen, ende‑til‑ende‑modell som erstatter den vanlige segmentering‑plus‑embedding‑pipeline og dens finjustering med ett enkelt pass, og merker talere med et konfigurerbart intervall så lavt som hver 320 millisekunder.
Arkitektur og latensprofiler
Ifølge NVIDIAs modellkort er modellen designet for å fastslå «hvem snakket når» i lyd fra den virkelige verden, støtter både streaming‑ og offline‑inferenz, og er klar for kommersiell eller ikke‑kommersielt bruk. Den er en 100‑million‑parameter, 31‑lag Transformer‑enkoder med Rotary Positional Embeddings. Innkommende 16 kHz enkelt‑kanal lyd konverteres til 10‑millisekunders mel‑spektral‑rammer, nedprøves med en faktor på åtte til en 80‑millisekunders enkoderrammefrekvens, og et Conv1D‑lag over enkoderen oppskalerer prediksjoner tilbake til 10‑millisekunders inngangsoppløsning. Modellen produserer en tensor med sannsynligheter for aktivitet per taler med formen T, 8, og de åtte talerkanelene er sortert etter hver talers første opptreden i lyden.
For streaming bruker modellen Arrival‑Order Speaker Cache og FIFO‑køen introdusert i NVIDIAs Streaming Sortformer‑arbeid: cachen beholder talerinformasjon fra tidligere segmenter slik at den første stemmen som høres beholder sin etikett, mens køen gir nylig ramme‑kontekst for hvert behandlingssteg. Designet krever ingen innbygginger eller klynging, og segmentert inferens setter ingen fast grense for lydvarighet.
Et enkelt sjekkpunkt betjener fire anbefalte latenskonfigurasjoner: 0.32, 0.64 og 1.04 sekunder, samt en offline‑stil 30.4‑sekunders inngangsbuffer. Kortet definerer denne latensen som inngangsbuffer‑latens — segmentlengde pluss høyrekontekst, multiplisert med 80 millisekunder — og bemerker at tallet ekskluderer beregnings‑prosesseringstid. Sjekkpunkten kan kjøres med en buffer så lav som 80 millisekunder, selv om 0.32 sekunder er den laveste anbefalte konfigurasjonen, og utgangs‑ramme‑oppløsning er konfigurerbar i multipler av 10 millisekunder.
Rapportert nøyaktighet og hastighet
NVIDIAs modellkort rapporterer diariseringsfeilrate, taler‑telle‑nøyaktighet og gjennomsnittlig absolutt feil i talertelling mot diar_streaming_sortformer_4spk-v2.1 baseline, med overlappende tale inkludert og en null‑sekunders kollare på hvert benchmark unntatt CALLHOME-Part2, som bruker en 0.25‑sekunders kollare. På DIHARD III rapporterer kortet en full‑sett feilrate på 12.73 ved 30.4‑sekunders profilen og 13.55 ved 0.32 sekunder, versus 19.09 og 19.85 for baseline. På NOTSOFAR1 enkelt‑kanal opptak rapporterer det 11.00 versus 30.49 ved offline‑profilen; på AMI Test SDM, 11.14 versus 21.42; på AliMeeting Test Near, 6.40 versus 11.57; og på CALLHOME-Part2, 9.10 versus 10.32. Kortet opplyser at dets AMI, AliMeeting og NOTSOFAR1‑resultater ble beregnet med tvungen‑justering referanselabeler, og at resultater scoret mot ulike referanse‑annotasjoner ikke er direkte sammenlignbare.
En hastighetstabell i kortet rapporterer real‑time‑factor‑forbedring, definert som total lydvarighet delt på total behandlingstid, på 1,340 i eager‑modus og 4,385 kompilert ved batch‑størrelse én på offline‑profilen, målt på en RTX PRO 5000 med BF16‑presisjon. Ved 0.32‑sekunders profilen er de tilsvarende tallene 12.5 og 54.
Baseten gjennomførte sin egen evaluering, også med feilrate med overlappende tale inkludert og uten kollare. Det rapporterer en feilrate på 9.8 prosent på AISHELL-4 ved lav‑latens‑profilen mot 27.2 prosent for Streaming Sortformer v2.1, og sier at overgangen fra 30‑sekunders offline‑profilen til 0.32‑sekunders ultra‑lav‑profil kun øker feilraten med én til to poeng. Baseten rapporterer at modellen overgikk Meta Muse Voice Transcribe på alle datasett den testet, selv i ultra‑lav‑konfigurasjonen, og tapte kun mot pyannote community-1 på AMI.
Treningsdata og lisensiering
Modellkortet oppgir omtrent 10,000 timer med ekte samtaler (inkludert Fisher English, AMI og ICSI møtekorpora, VoxConverse, AISHELL-4, AliMeeting, den tredje DIHARD‑utfordringen, CALLHOME, NOTSOFAR1, DISPLACE‑settene, lisensierte David AI‑opptak, og et pseudo‑merkert YODAS‑v2‑undersett) ved siden av 82,611 timer med fler‑taler‑blandinger simulert med FastMSS‑verktøyet fra omtrent 28,000 timer med enkelt‑taler‑opptak. Treningen startet fra et NEST‑selv‑overvåket sjekkpunkt og kjøres på åtte noder med åtte A100-80GB‑GPU‑er i to faser: offline‑trening på simulert data, etterfulgt av streaming‑finjustering på en kombinasjon av ekte og simulert lyd. Bruk av modellen er regulert av OpenMDW License Agreement, versjon 1.1.
Baseten‑tjenestepresets og kapasitet
Baseten eksponerer modellen gjennom tre forhåndsinnstillinger, hver kjørende på én RTX PRO 6000 bak en CUDA‑grafmotor bygget rundt NVIDIAs NeMo‑streaming‑loop, ifølge sin Model Library‑oppføring, som også beskriver modellen som etterfølgeren til Streaming Sortformer v2.1. Batch‑diariserings‑presetet er et HTTP‑endepunkt for innspilt lyd som returnerer taler‑bytter med en per‑forespørsel‑latensprofil. Streaming‑diariserings‑presetet er et WebSocket‑endepunkt for live‑lyd som bærer taler‑identitet gjennom en samtale uten ny‑klustering. Streaming‑diariserte‑transkripsjon parer diarizeren med NVIDIAs Parakeet V2‑taleteknologimodell, et system med 600 millioner parametere, og returnerer taler‑merkede ord med tidsstempler, per‑taler‑delresultater og overlapps‑flagg. Baseten sier at dette presetet mater per‑taler‑aktivitetsvektorer direkte inn i Parakeets innledende enkoderlager slik at overlappende tale transkriberes i ett enkelt pass, med taler‑etiketter endelige ved ankomst og ord som er bekreftet aldri revideres.
Baseten rapporterer at én RTX PRO 6000 opprettholder mer enn 500 samtidige én‑time‑lange diariserings‑strømmer ved 1,04‑sekunders profilen, 200 strømmer ved 0,32‑sekunders profilen, og 190 én‑time‑lange strømmer når transkripsjon legges til, mens batch‑presetet behandler 200 seks‑minutters lydfiler per minutt. Ved bruk av identiske filer og maskinvare rapporterer Baseten at deres optimaliserte preset leverte omtrent 1,35 ganger høyere batch‑gjennomstrømning enn NVIDIA‑referanseoppsettet de testet, under k6‑generert belastning i klyngen med en‑strøm‑kontroll på en inaktiv replika.
Baseten sier også at modellens per‑taler‑aktivitets‑signal, sporet i 10‑millisekunders intervaller, kan drive stemme‑aktivitet‑deteksjon, taler‑spesifikk slutt‑på‑tur‑deteksjon, samt håndtering av tur‑bytte og avbrytelser, og responderer på omtrent 300 millisekunder i ultra‑lav‑latens‑innstillinger.
Nemotron 3 Diarization er tilgjengelig på Hugging Face under depotet nvidia/Nemotron-3-Diarization og i Basetens Model Library, med NeMo‑Framework v3.0‑integrasjon og støtte for NVIDIA‑Ampere, Ada Lovelace, Hopper‑ og Blackwell‑GPUer.












