AI-modeller og platforme

NVIDIA udgiver Nemotron 3 Diarization Open-Weight talermodel

mm
Føj Unite.AI til dine foretrukne kilder på Google

NVIDIA udgav den 23. september 2026 Nemotron 3 Diarization, en open-weight talediariseringsmodel, der kan identificere op til otte talere i live- eller optaget lyd, og Baseten annoncerede samme-dags serveringssupport med batch-, streaming- og diariseret-transskriptions‑presets, som hver kører på én RTX PRO 6000 GPU.

Talediarisering segmenterer en lydstrøm efter, hvornår hver særskilt taler taler, udgiver tidsstempler for hver stemme og tildeler hvert interval en ensartet label; i kombination med transskription tilskrives de transskriberede ord den person, der sagde dem. Basetens meddelelse beskriver Nemotron 3 Diarization som en åben, end‑to‑end model, der erstatter den sædvanlige segmentering‑plus‑embedding‑pipeline og dens finjustering med et enkelt gennemløb, som mærker talere med et konfigurerbart interval så lavt som hver 320 millisekunder.

Arkitektur og latenstidprofiler

Ifølge NVIDIAs modelkort er modellen designet til at bestemme \”hvem talte hvornår\” i lyd fra den virkelige verden, understøtter både streaming‑ og offline‑inference og er klar til kommerciel eller ikke‑kommerciel brug. Den er en 100‑million‑parameter, 31‑lag Transformer‑encoder med roterende positions‑indlejringer. Indkommende 16 kHz enkelt‑kanal lyd konverteres til 10‑millisekunders mel‑spektral‑rammer, nedprøves med en faktor på otte til en 80‑millisekunders encoder‑rammehastighed, og et Conv1D‑lag over encoder’en opsamler forudsigelserne tilbage til 10‑millisekunders input‑opløsning. Modellen udgiver en tensor af per‑taler aktivitets‑sandsynligheder med formen T, 8, og dens otte talerkaneler er ordnet efter hver talers første ankomst i lyden.

Til streaming bruger modellen Arrival-Order Speaker Cache og FIFO‑køen, som blev introduceret i NVIDIAs Streaming Sortformer‑arbejde: cachen bevarer talerinformation fra tidligere segmenter, så den første hørede stemme beholder sin label, mens køen giver nylig ramme‑kontekst for hvert behandlings‑trin. Designet kræver ingen indlejringer eller klyngedannelse, og segmenteret inference sætter ingen fast grænse for lydens varighed.

Et enkelt checkpoint betjener fire anbefalede latenstidskonfigurationer: 0.32, 0.64 og 1.04 sekunder, samt en offline‑stil 30.4‑sekunders input‑buffer. Kortet definerer denne latenstid som input‑buffer‑latenstid — segmentlængde plus højre kontekst, multipliceret med 80 millisekunder — og bemærker, at tallet ekskluderer beregnings‑processeringstid. Checkpoint’et kan køre med en buffer så lav som 80 millisekunder, selvom 0.32 sekunder er den laveste anbefalede konfiguration, og output‑ramme‑opløsning er konfigurerbar i multipla af 10 millisekunder.

Rapporteret nøjagtighed og hastighed

NVIDIAs modelkort rapporterer diariseringsfejlrate, taleroptællingsnøjagtighed og taleroptællings gennemsnitlige absolutte fejl i forhold til diar_streaming_sortformer_4spk-v2.1 baseline, med overlappende tale inkluderet og en nul‑sekunds margin på hver benchmark undtagen CALLHOME-Part2, som bruger en 0.25‑sekunds margin. På DIHARD III rapporterer kortet en fuld‑sæt fejlrate på 12.73 ved 30.4‑sekunds profilen og 13.55 ved 0.32 sekunder, versus 19.09 og 19.85 for baselinen. På NOTSOFAR1 enkelt‑kanal optagelser rapporterer det 11.00 versus 30.49 ved offline‑profilen; på AMI Test SDM, 11.14 versus 21.42; på AliMeeting Test Near, 6.40 versus 11.57; og på CALLHOME-Part2, 9.10 versus 10.32. Kortet angiver, at dets AMI, AliMeeting og NOTSOFAR1 scores blev beregnet med tvangs‑justering reference‑labels og at resultater scoret mod forskellige reference‑annotationer ikke er direkte sammenlignelige.

En hastighedstabel i kortet rapporterer real‑time‑faktor hastighedsforøgelse, defineret som total lydvarighed divideret med total behandlingstid, på 1,340 i eager‑tilstand og 4,385 kompileret ved batch‑størrelse én på offline‑profilen, målt på en RTX PRO 5000 med BF16‑præcision. Ved 0.32‑sekunds profilen er de tilsvarende tal 12.5 og 54.

Baseten gennemførte sin egen evaluering, som også målte fejlrate med overlappende tale inkluderet og uden margin. Den rapporterer en fejlrate på 9.8 % på AISHELL-4 ved den lav‑latenstidsprofil mod 27.2 % for Streaming Sortformer v2.1, og siger at overgangen fra den 30‑sekunders offline‑profil til den 0.32‑sekunds ultra‑lav‑profil kun øger fejlraten med én til to point. Baseten rapporterer, at modellen overgik Meta Muse Voice Transcribe på alle datasæt, den testede, selv i den ultra‑lav‑konfiguration, og kun tabte til pyannote community-1 på AMI.

Træningsdata og licensiering

Modelkortet angiver ca. 10,000 timers reelle samtaler (inklusive Fisher English, AMI‑ og ICSI‑mødekorpora, VoxConverse, AISHELL‑4, AliMeeting, den tredje DIHARD‑udfordring, CALLHOME, NOTSOFAR1, DISPLACE‑sættene, licenserede David AI‑optagelser og et pseudo‑mærket YODAS‑v2‑undersæt) sammen med 82,611 timers multi‑taler blandinger simuleret med FastMSS‑værktøjssættet fra omkring 28,000 timers enkelt‑taler optagelser. Træningen startede fra et NEST selv‑superviseret checkpoint og kørte på otte noder med otte A100‑80GB GPU’er i to faser: offline‑træning på simuleret data, efterfulgt af streaming‑finjustering på en kombination af reelle og simulerede lydoptagelser. Brug af modellen er reguleret af OpenMDW License Agreement, version 1.1.

Baseten serverings‑presets og kapacitet

Baseten eksponerer modellen gennem tre forudindstillinger, hver kørende på en RTX PRO 6000 bag en CUDA-graph-motor bygget omkring NVIDIAs NeMo streaming-loop, ifølge dens Model Library-oversigt, som også beskriver modellen som efterfølgeren til Streaming Sortformer v2.1. Batch Diarization-forudindstillingen er et HTTP-endpoint for optaget lyd, der returnerer talerens skift med en per-anmodning latenstidprofil. Streaming Diarization er et WebSocket-endpoint for live-lyd, der overfører taleridentitet gennem en samtale uden gen‑klustering. Streaming Diarized Transcription kombinerer diarizeren med NVIDIAs Parakeet V2 talegenkendelsesmodel, et system med 600 millioner parametre, og returnerer taler‑mærkede ord med tidsstempler, per‑taler delvise resultater og overlappningsflag. Baseten siger, at denne forudindstilling fodrer per‑taler aktivitetsvektorer direkte ind i Parakeets indledende encoder‑lag, så overlappende tale transskriberes i ét pass, med talermærkater endelige ved ankomst og ord, der er bekræftet, aldrig revideres.

Baseten rapporterer, at en RTX PRO 6000 kan opretholde mere end 500 samtidige timelange diariseringsstrømme ved 1,04‑sekunders profilen, 200 strømme ved 0,32‑sekunders profilen og 190 timelange strømme, når transskription tilføjes, mens batch‑forudindstillingen behandler 200 seks‑minutters lydfiler per minut. Ved brug af identiske filer og hardware rapporterer Baseten, at deres optimerede forudindstilling leverede cirka 1,35 gange højere batch‑gennemløb end den NVIDIA‑referenceopsætning, de testede, under k6‑genereret belastning i klyngen med en‑strøm kontrol på en inaktiv replika.

Baseten siger også, at modellens per‑taler aktivitetsignal, sporet i 10‑millisekunders intervaller, kan drive stemmeaktivitetssporing, taler‑specifik slut‑på‑turn‑detektion samt håndtering af tur‑tagning og afbrydelser, og responderer på cirka 300 millisekunder i ultra‑lav‑latens‑indstillinger.

Nemotron 3 Diarization er tilgængelig på Hugging Face under lageret nvidia/Nemotron-3-Diarization og i Basetens Model Library, med NeMo Framework v3.0-integration og understøttelse af NVIDIA Ampere, Ada Lovelace, Hopper og Blackwell GPU’er.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, der fokuserer på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde udforsker, hvordan læring, resonnering, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og hvordan der kan trækkes forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål i kognitiv videnskab og filosofi om sindet.
Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som resonneringsmodeller, agente systemer, emergent kognition og alignment-teori, med det formål at klargøre, hvad fremgang mod AGI faktisk betyder - og hvad det ikke gør. I stedet for at jagte tidsfrister eller hype lægger han vægt på første principper, konceptuel rigor og grænserne for nuværende modeller.
Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncepter.