KI-Modelle und Plattformen
NVIDIA veröffentlicht Nemotron 3 Diarization Open-Weight Sprecher‑Modell

NVIDIA hat am 23. September 2026 Nemotron 3 Diarization veröffentlicht, ein Open‑Weight‑Sprecher‑Diarisationsmodell, das bis zu acht Sprecher in Live‑ oder aufgezeichnetem Audio identifiziert, und Baseten kündigte am selben Tag einen Servicing‑Support mit den Presets Batch, Streaming und diarisiert‑Transkription an, die jeweils auf einer RTX PRO 6000‑GPU laufen.
Die Sprecher‑Diarisation segmentiert einen Audiostream nach den Zeitpunkten, zu denen jeder einzelne Sprecher spricht, gibt Zeitstempel für jede Stimme aus und weist jedem Abschnitt ein konsistentes Label zu; in Kombination mit der Transkription ordnet sie transkribierte Wörter der Person zu, die sie gesprochen hat. Ankündigung von Baseten beschreibt Nemotron 3 Diarization als ein offenes End‑to‑End‑Modell, das die übliche Segmentierungs‑plus‑Embedding‑Pipeline und deren Feinabstimmung durch einen einzigen Durchlauf ersetzt und Sprecher in einem konfigurierbaren Intervall von bis zu 320 Millisekunden kennzeichnet.
Architektur und Latenzprofile
Laut Modellkarte von NVIDIA ist das Modell darauf ausgelegt, im realen Audio zu bestimmen, „wer wann gesprochen hat“, unterstützt sowohl Streaming‑ als auch Offline‑Inference und ist für kommerzielle sowie nicht‑kommerzielle Nutzung bereit. Es handelt sich um einen Transformer‑Encoder mit 100 Millionen Parametern und 31 Schichten, ausgestattet mit rotierenden Positions‑Embeddings. Eingehendes 16 kHz‑Mono‑Audio wird in 10‑Millisekunden‑Mel‑Spektrogramm‑Frames umgewandelt, um den Faktor acht auf eine Encoder‑Frame‑Rate von 80 Millisekunden heruntergesampelt, und eine Conv1D‑Schicht über dem Encoder hochskaliert die Vorhersagen wieder auf die 10‑Millisekunden‑Eingangsauflösung. Das Modell gibt einen Tensor mit Wahrscheinlichkeiten für die Aktivität pro Sprecher aus, dessen Form T, 8 hat, und die acht Sprecherkanäle sind nach dem ersten Auftreten jedes Sprechers im Audio geordnet.
Für das Streaming verwendet das Modell den Arrival‑Order‑Speaker‑Cache und die FIFO‑Warteschlange, die in NVIDIA’s Streaming‑Sortformer‑Arbeit eingeführt wurden: Der Cache speichert Sprecherinformationen aus früheren Chunks, sodass die zuerst gehörte Stimme ihr Label behält, während die Warteschlange für jeden Verarbeitungsschritt einen Kontext der letzten Frames liefert. Das Design benötigt weder Embeddings noch Clustering, und die chunkweise Inferenz setzt keine feste Obergrenze für die Audiodauer.
Ein einzelner Checkpoint unterstützt vier empfohlene Latenzkonfigurationen: 0,32 s, 0,64 s und 1,04 s sowie einen Offline‑Stil‑Eingabepuffer von 30,4 s. Die Karte definiert diese Latenz als Eingabepuffer‑Latenz — Chunk‑Länge plus rechter Kontext, multipliziert mit 80 Millisekunden — und weist darauf hin, dass die Angabe die Rechenzeit nicht berücksichtigt. Der Checkpoint kann mit einem Puffer von nur 80 Millisekunden laufen, wobei 0,32 s die niedrigste empfohlene Konfiguration ist, und die Auflösung der Ausgabeframes ist in Vielfachen von 10 Millisekunden konfigurierbar.
Gemeldete Genauigkeit und Geschwindigkeit
Die Modellkarte von NVIDIA berichtet die Diarisationsfehlerquote, die Genauigkeit der Sprecherzählung und den mittleren absoluten Fehler der Sprecherzählung gegenüber dem diar_streaming_sortformer_4spk-v2.1 Baseline, wobei überlappende Sprache einbezogen und bei jedem Benchmark ein Null‑Sekunden‑Collar verwendet wird, außer bei CALLHOME‑Part2, das ein 0,25‑Sekunden‑Collar nutzt. Auf DIHARD III berichtet die Karte eine Gesamtfehlerquote von 12,73 im 30,4‑Sekunden‑Profil und 13,55 bei 0,32 s, gegenüber 19,09 bzw. 19,85 für die Basislinie. Bei den ein‑Kanal‑Aufnahmen von NOTSOFAR1 werden 11,00 gegenüber 30,49 im Offline‑Profil angegeben; bei AMI Test SDM 11,14 gegenüber 21,42; bei AliMeeting Test Near 6,40 gegenüber 11,57; und bei CALLHOME‑Part2 9,10 gegenüber 10,32. Die Karte gibt an, dass die AMI‑, AliMeeting‑ und NOTSOFAR1‑Werte mit erzwungenen Alignment‑Referenzlabels berechnet wurden und dass Ergebnisse, die gegen unterschiedliche Referenzannotationen bewertet wurden, nicht direkt vergleichbar sind.
Eine Geschwindigkeits‑Tabelle in der Karte gibt einen Real‑Time‑Factor‑Speedup von 1.340 im eager‑Modus und 4.385 im kompilierten Modus bei Batch‑Größe 1 im Offline‑Profil an, gemessen auf einer RTX PRO 5000 mit BF16‑Präzision. Im 0,32‑Sekunden‑Profil betragen die entsprechenden Werte 12,5 und 54.
Baseten führte eine eigene Evaluation durch und bewertete ebenfalls die Fehlerquote bei einbezogener überlappender Sprache und ohne Collar. Es meldet eine Fehlerquote von 9,8 % auf AISHELL‑4 im Low‑Latency‑Profil gegenüber 27,2 % für Streaming Sortformer v2.1 und gibt an, dass der Wechsel vom 30‑Sekunden‑Offline‑Profil zum 0,32‑Sekunden‑Ultra‑Low‑Profil die Fehlerquote nur um ein bis zwei Punkte erhöht. Baseten berichtet, dass das Modell Meta Muse Voice Transcribe in jedem getesteten Datensatz, selbst in der Ultra‑Low‑Konfiguration, übertroffen hat und nur gegenüber pyannote community‑1 im AMI‑Datensatz verloren hat.
Trainingsdaten und Lizenzierung
Die Modellkarte führt etwa 10 000 Stunden realer Gespräche auf (darunter Fisher English, die AMI‑ und ICSI‑Meeting‑Korpora, VoxConverse, AISHELL‑4, AliMeeting, die dritte DIHARD‑Challenge, CALLHOME, NOTSOFAR1, die DISPLACE‑Sätze, lizenzierte David‑AI‑Aufnahmen und ein pseudo‑gelabeltes YODAS‑v2‑Subset) sowie 82 611 Stunden von Mehrsprecher‑Mischungen, die mit dem FastMSS‑Toolkit aus etwa 28 000 Stunden Einzelsprecher‑Aufnahmen simuliert wurden. Das Training wurde von einem NEST‑self‑supervised‑Checkpoint aus initiiert und lief auf acht Knoten mit je acht A100‑80 GB‑GPUs in zwei Phasen: Offline‑Training mit simulierten Daten, gefolgt von Streaming‑Feinabstimmung auf einer Kombination aus realen und simulierten Audiodaten. Die Nutzung des Modells unterliegt dem OpenMDW‑License‑Agreement, Version 1.1.
Baseten‑Serving‑Presets und Kapazität
Baseten stellt das Modell über drei Presets bereit, die jeweils auf einer RTX PRO 6000 hinter einer CUDA-Graph-Engine laufen, die um die Streaming‑Schleife von NVIDIA NeMo gebaut ist, laut sein Model Library‑Eintrag, der das Modell auch als Nachfolger von Streaming Sortformer v2.1 beschreibt. Das Batch‑Diarisation‑Preset ist ein HTTP‑Endpunkt für aufgezeichnete Audiodaten, der Sprecherwechsel mit einem Latenzprofil pro Anfrage zurückgibt. Streaming Diarisation ist ein WebSocket‑Endpunkt für Live‑Audio, der die Sprecheridentität über ein Gespräch hinweg trägt, ohne erneutes Clustering. Streaming Diarised Transcription kombiniert den Diarisierer mit NVIDIA‑s Parakeet V2‑Spracherkennungsmodell, einem System mit 600 Millionen Parametern, und liefert sprechergekennzeichnete Wörter mit Zeitstempeln, teilweisen Ausgaben pro Sprecher und Überlappungs‑Flags. Baseten sagt, dass dieses Preset sprecherbezogene Aktivitätsvektoren direkt in die ersten Encoder‑Schichten von Parakeet einspeist, sodass überlappende Sprache in einem Durchlauf transkribiert wird, wobei Sprecherlabels bei Ankunft finalisiert werden und übermittelte Wörter nie nachträglich geändert werden.
Baseten berichtet, dass eine RTX PRO 6000 mehr als 500 gleichzeitige einstündige Diarisierungs‑Streams bei dem 1,04‑Sekunden‑Profil, 200 Streams beim 0,32‑Sekunden‑Profil und 190 einstündige Streams, wenn die Transkription hinzugefügt wird, aufrechterhalten kann, während das Batch‑Preset 200 Audiodateien von jeweils sechs Minuten pro Minute verarbeitet. Mit identischen Dateien und Hardware berichtet Baseten, dass sein optimiertes Preset etwa das 1,35‑fache des Batch‑Durchsatzes im Vergleich zu dem von NVIDIA getesteten Referenz‑Setup erzielt hat, unter k6‑generierter Last im Cluster mit einem Ein‑Stream‑Steuerung auf einer untätigen Replik.
Baseten sagt außerdem, dass das pro‑Sprecher‑Aktivitätssignal des Modells, das in 10‑Millisekunden‑Schritten verfolgt wird, Sprachaktivitätserkennung, sprecher‑spezifische End‑der‑Rede‑Erkennung sowie Turn‑Taking‑ und Unterbrechungs‑Handling steuern kann und dabei bei ultra‑niedrigen Latenzeinstellungen in etwa 300 Millisekunden reagiert.
Nemotron 3 Diarization ist auf Hugging Face im Repository nvidia/Nemotron-3-Diarization und in Basetens Model Library verfügbar, mit Integration von NeMo Framework v3.0 und Unterstützung für NVIDIA‑Ampere-, Ada‑Lovelace-, Hopper- und Blackwell‑GPUs.












