Modelli e piattaforme di IA
NVIDIA rilascia Nemotron 3 Diarization, modello di speaker diarization open-weight

Il 23 settembre 2026 NVIDIA ha rilasciato Nemotron 3 Diarization, un modello di speaker diarization open-weight che identifica fino a otto speaker in audio live o registrato, e Baseten ha annunciato supporto al servizio nello stesso giorno con preset batch, streaming e diarized-transcription, ognuno dei quali gira su una GPU RTX PRO 6000.
La diarizzazione degli speaker segmenta un flusso audio in base a quando ciascun speaker distinto parla, fornisce i tempi per ogni voce e assegna a ogni intervallo un’etichetta coerente; abbinata alla trascrizione, attribuisce le parole trascritte alla persona che le ha pronunciate. l’annuncio di Baseten descrive Nemotron 3 Diarization come un modello open, end-to-end che sostituisce la consueta pipeline di segmentazione più embedding e la sua messa a punto con un unico passaggio, etichettando gli speaker a un intervallo configurabile anche di soli 320 millisecondi.
Architettura e profili di latenza
Secondo la scheda modello di NVIDIA, il modello è progettato per determinare “chi ha parlato quando” in audio del mondo reale, supporta sia lo streaming che l’inferenza offline, ed è pronto per un uso commerciale o non commerciale. È un encoder Transformer a 31 strati con 100 milioni di parametri e Rotary Positional Embeddings. L’audio in ingresso a 16 kHz monofonico viene convertito in frame mel-spettrogramma da 10 millisecondi, sottocampionato di un fattore otto fino a una frequenza di frame dell’encoder di 80 millisecondi, e uno strato Conv1D sopra l’encoder ri‑campiona le previsioni alla risoluzione di ingresso di 10 millisecondi. Il modello produce un tensore di probabilità di attività per speaker con forma T, 8, e i suoi otto canali speaker sono ordinati in base al primo arrivo di ciascun speaker nell’audio.
Per lo streaming, il modello utilizza l’Arrival-Order Speaker Cache e la coda FIFO introdotti nel lavoro Streaming Sortformer di NVIDIA: la cache conserva le informazioni sugli speaker dai segmenti precedenti in modo che la prima voce ascoltata mantenga la sua etichetta, mentre la coda fornisce il contesto dei frame recenti per ogni fase di elaborazione. Il design non richiede embedding né clustering, e l’inferenza a blocchi non impone alcun limite fisso alla durata dell’audio.
Un singolo checkpoint serve quattro configurazioni di latenza consigliate: 0.32, 0.64 e 1.04 secondi, più un buffer di ingresso in stile offline di 30.4 secondi. La scheda definisce questa latenza come latenza del buffer di ingresso — lunghezza del blocco più contesto destro, moltiplicata per 80 millisecondi — e osserva che il valore esclude il tempo di elaborazione computazionale. Il checkpoint può funzionare con un buffer anche di 80 millisecondi, sebbene 0.32 secondi sia la configurazione più bassa consigliata, e la risoluzione dei frame in output è configurabile in multipli di 10 millisecondi.
Precisione e velocità riportate
La scheda modello di NVIDIA riporta il tasso di errore di diarizzazione, l’accuratezza del conteggio degli speaker e l’errore medio assoluto del conteggio degli speaker rispetto al diar_streaming_sortformer_4spk-v2.1 baseline, con il parlato sovrapposto incluso e un collar di zero secondi su ogni benchmark eccetto CALLHOME-Part2, che utilizza un collar di 0.25 secondi. Su DIHARD III, la scheda riporta un tasso di errore dell’intero set del 12.73 al profilo di 30.4 secondi e 13.55 a 0.32 secondi, rispetto a 19.09 e 19.85 per la baseline. Su registrazioni monofoniche NOTSOFAR1 riporta 11.00 contro 30.49 al profilo offline; su AMI Test SDM, 11.14 contro 21.42; su AliMeeting Test Near, 6.40 contro 11.57; e su CALLHOME-Part2, 9.10 contro 10.32. La scheda afferma che i punteggi AMI, AliMeeting e NOTSOFAR1 sono stati calcolati con etichette di riferimento a forzata allineamento e che i risultati valutati rispetto a diverse annotazioni di riferimento non sono direttamente comparabili.
Una tabella di velocità nella scheda riporta un’accelerazione real-time-factor, definita come durata totale dell’audio divisa per il tempo totale di elaborazione, di 1,340 in modalità eager e 4,385 compilata con batch size uno sul profilo offline, misurata su una RTX PRO 5000 a precisione BF16. Al profilo di 0.32 secondi, i valori corrispondenti sono 12.5 e 54.
Baseten ha effettuato una propria valutazione, segnando anche il tasso di errore con parlato sovrapposto incluso e senza collar. Riporta un tasso di errore del 9.8 percento su AISHELL-4 al profilo a bassa latenza contro il 27.2 percento per Streaming Sortformer v2.1, e afferma che il passaggio dal profilo offline di 30 secondi al profilo ultra‑basso di 0.32 secondi aumenta il tasso di errore di solo uno o due punti. Baseten segnala che il modello ha superato Meta Muse Voice Transcribe su tutti i dataset testati, anche nella configurazione ultra‑bassa, e ha perso contro pyannote community-1 solo su AMI.
Dati di addestramento e licenza
La scheda modello elenca circa 10,000 ore di conversazioni reali (inclusi Fisher English, i corpora di riunioni AMI e ICSI, VoxConverse, AISHELL-4, AliMeeting, la terza sfida DIHARD, CALLHOME, NOTSOFAR1, i set DISPLACE, registrazioni David AI con licenza e un sottoinsieme pseudo‑etichettato YODAS-v2) accanto a 82,611 ore di miscele multi‑speaker simulate con il toolkit FastMSS da circa 28,000 ore di registrazioni monofoniche. L’addestramento è stato inizializzato da un checkpoint auto‑supervisionato NEST e ha funzionato su otto nodi di otto GPU A100-80GB in due fasi: addestramento offline su dati simulati, seguito da fine‑tuning streaming su una combinazione di audio reale e simulato. L’uso del modello è regolato dall’OpenMDW License Agreement, versione 1.1.
Preset di serving Baseten e capacità
Baseten espone il modello tramite tre preset, ciascuno eseguito su un RTX PRO 6000 dietro un motore CUDA‑graph costruito attorno al ciclo di streaming NeMo di NVIDIA, secondo il suo elenco nella Model Library, che descrive inoltre il modello come successore di Streaming Sortformer v2.1. Il preset Batch Diarization è un endpoint HTTP per audio registrato che restituisce i turni degli speaker con un profilo di latenza per richiesta. Streaming Diarization è un endpoint WebSocket per audio in tempo reale che mantiene l’identità dello speaker durante una conversazione senza riclusterizzare. Streaming Diarized Transcription accoppia il diarizzatore con il modello di riconoscimento vocale Parakeet V2 di NVIDIA, un sistema da 600 milioni di parametri, e restituisce parole etichettate per speaker con tempi, parziali per speaker e flag di sovrapposizione. Baseten afferma che questo preset alimenta i vettori di attività per speaker direttamente negli strati encoder iniziali di Parakeet, così il parlato sovrapposto viene trascritto in un’unica passata, con le etichette degli speaker finalizzate all’arrivo e le parole confermate mai riviste.
Baseten segnala che un RTX PRO 6000 mantiene più di 500 flussi di diarizzazione simultanei di un’ora al profilo di 1,04 secondi, 200 flussi al profilo di 0,32 secondi e 190 flussi di un’ora quando viene aggiunta la trascrizione, mentre il preset batch elabora 200 file audio di sei minuti al minuto. Utilizzando file e hardware identici, Baseten riporta che il suo preset ottimizzato ha fornito circa 1,35 volte più throughput batch rispetto alla configurazione di riferimento NVIDIA testata, sotto carico generato da k6 all’interno del cluster con un controllo a singolo flusso su una replica inattiva.
Baseten afferma inoltre che il segnale di attività per speaker del modello, tracciato a intervalli di 10 millisecondi, può guidare il rilevamento dell’attività vocale, il rilevamento della fine del turno specifico per speaker e la gestione del turno e delle interruzioni, rispondendo in circa 300 millisecondi su impostazioni a latenza ultra‑bassa.
Nemotron 3 Diarization è disponibile su Hugging Face nel repository nvidia/Nemotron-3-Diarization e nella Model Library di Baseten, con integrazione NeMo Framework v3.0 e supporto per le GPU NVIDIA Ampere, Ada Lovelace, Hopper e Blackwell.












