Model dan platform AI
NVIDIA Merilis Model Pembicara Open-Weight Nemotron 3 Diarization

NVIDIA pada 23 September 2026 merilis Nemotron 3 Diarization, sebuah model diarization pembicara open-weight yang dapat mengidentifikasi hingga delapan pembicara dalam audio langsung atau rekaman, dan Baseten mengumumkan dukungan layanan pada hari yang sama dengan preset batch, streaming, dan diarized-transcription yang masing-masing dijalankan pada satu GPU RTX PRO 6000.
Diarization pembicara memotong aliran audio berdasarkan kapan setiap pembicara yang berbeda berbicara, menghasilkan waktu untuk setiap suara, dan memberikan setiap rentang label yang konsisten; dipasangkan dengan transkripsi, ia mengaitkan kata-kata yang ditranskripsi dengan orang yang mengucapkannya. Pengumuman Baseten menjelaskan Nemotron 3 Diarization sebagai model terbuka end-to-end yang menggantikan pipeline segmentasi-plus-embedding yang biasa serta penyetelannya dengan satu kali proses, memberi label pembicara pada interval yang dapat dikonfigurasi serendah setiap 320 milidetik.
Arsitektur dan Profil Latensi
Menurut kartu model NVIDIA, model ini dirancang untuk menentukan \”siapa yang berbicara kapan\” dalam audio dunia nyata, mendukung inferensi streaming maupun offline, dan siap untuk penggunaan komersial atau non-komersial. Model ini memiliki 100 juta parameter, encoder Transformer 31 lapisan dengan Rotary Positional Embeddings. Audio masuk berfrekuensi 16 kHz satu saluran diubah menjadi frame mel-spektrogram 10 milidetik, diturunkan sampelnya dengan faktor delapan menjadi laju frame encoder 80 milidetik, dan lapisan Conv1D di atas encoder meningkatkan kembali prediksi ke resolusi input 10 milidetik. Model menghasilkan tensor probabilitas aktivitas per-pembicara dengan bentuk T, 8, dan delapan saluran pembicara diurutkan berdasarkan kedatangan pertama masing-masing pembicara dalam audio.
Untuk streaming, model ini menggunakan Arrival-Order Speaker Cache dan antrian FIFO yang diperkenalkan dalam karya Streaming Sortformer milik NVIDIA: cache menyimpan informasi pembicara dari potongan sebelumnya sehingga suara pertama yang terdengar mempertahankan labelnya, sementara antrian menyediakan konteks frame terbaru untuk setiap langkah pemrosesan. Desain ini tidak memerlukan embedding atau clustering, dan inferensi berbasis potongan tidak menetapkan batas tetap pada durasi audio.
Satu checkpoint melayani empat konfigurasi latensi yang direkomendasikan: 0,32, 0,64, dan 1,04 detik, serta buffer input bergaya offline 30,4 detik. Kartu mendefinisikan latensi ini sebagai latensi buffer input — panjang potongan ditambah konteks kanan, dikalikan 80 milidetik — dan mencatat bahwa angka tersebut tidak termasuk waktu pemrosesan komputasi. Checkpoint dapat dijalankan dengan buffer serendah 80 milidetik, meskipun 0,32 detik adalah konfigurasi terendah yang direkomendasikan, dan resolusi frame output dapat dikonfigurasi dalam kelipatan 10 milidetik.
Akurasi dan Kecepatan yang Dilaporkan
Kartu model NVIDIA melaporkan tingkat kesalahan diarization, akurasi penghitungan pembicara, dan kesalahan absolut rata-rata penghitungan pembicara terhadap diar_streaming_sortformer_4spk-v2.1 baseline, dengan suara tumpang tindih termasuk dan kolar nol detik pada setiap benchmark kecuali CALLHOME-Part2, yang menggunakan kolar 0,25 detik. Pada DIHARD III, kartu melaporkan tingkat kesalahan set lengkap sebesar 12,73 pada profil 30,4 detik dan 13,55 pada 0,32 detik, dibandingkan dengan 19,09 dan 19,85 untuk baseline. Pada rekaman satu saluran NOTSOFAR1, dilaporkan 11,00 versus 30,49 pada profil offline; pada AMI Test SDM, 11,14 versus 21,42; pada AliMeeting Test Near, 6,40 versus 11,57; dan pada CALLHOME-Part2, 9,10 versus 10,32. Kartu menyatakan bahwa skor AMI, AliMeeting, dan NOTSOFAR1 dihitung dengan label referensi forced-alignment dan bahwa hasil yang dinilai terhadap anotasi referensi yang berbeda tidak dapat dibandingkan secara langsung.
Tabel kecepatan dalam kartu melaporkan percepatan faktor waktu nyata, yang didefinisikan sebagai total durasi audio dibagi total waktu pemrosesan, sebesar 1,340 dalam mode eager dan 4,385 terkompilasi pada ukuran batch satu pada profil offline, diukur pada RTX PRO 5000 dengan presisi BF16. Pada profil 0,32 detik, angka yang bersesuaian adalah 12,5 dan 54.
Baseten melakukan evaluasi sendiri, juga menghitung tingkat kesalahan dengan suara tumpang tindih termasuk dan tanpa kolar. Mereka melaporkan tingkat kesalahan 9,8 persen pada AISHELL-4 pada profil latensi rendah dibandingkan 27,2 persen untuk Streaming Sortformer v2.1, dan menyatakan bahwa berpindah dari profil offline 30 detik ke profil ultra-rendah 0,32 detik hanya meningkatkan tingkat kesalahan satu hingga dua poin. Baseten melaporkan model ini mengungguli Meta Muse Voice Transcribe pada setiap dataset yang diuji, bahkan pada konfigurasi ultra-rendah, dan kalah dari pyannote community-1 hanya pada AMI.
Data Pelatihan dan Lisensi
Kartu model mencantumkan kira-kira 10.000 jam percakapan nyata (termasuk Fisher English, korpus pertemuan AMI dan ICSI, VoxConverse, AISHELL-4, AliMeeting, tantangan DIHARD ketiga, CALLHOME, NOTSOFAR1, set DISPLACE, rekaman David AI berlisensi, dan subset YODAS-v2 yang pseudo-berlabel) bersama dengan 82.611 jam campuran multi-pembicara yang disimulasikan dengan toolkit FastMSS dari sekitar 28.000 jam rekaman satu pembicara. Pelatihan dimulai dari checkpoint NEST self-supervised dan dijalankan pada delapan node dengan delapan GPU A100-80GB dalam dua tahap: pelatihan offline pada data simulasi, diikuti dengan fine-tuning streaming pada kombinasi audio nyata dan simulasi. Penggunaan model diatur oleh OpenMDW License Agreement versi 1.1.
Preset Penyajian Baseten dan Kapasitas
Baseten mengekspos model melalui tiga preset, masing‑masing dijalankan pada satu RTX PRO 6000 di belakang mesin CUDA‑graph yang dibangun di sekitar loop streaming NVIDIA NeMo, menurut daftar Model Library‑nya, yang juga menggambarkan model tersebut sebagai penerus Streaming Sortformer v2.1. Preset Batch Diarization adalah endpoint HTTP untuk audio rekaman yang mengembalikan giliran pembicara dengan profil latensi per permintaan. Streaming Diarization adalah endpoint WebSocket untuk audio langsung yang membawa identitas pembicara sepanjang percakapan tanpa melakukan pengelompokan ulang. Streaming Diarized Transcription menggabungkan diarizer dengan model pengenalan suara NVIDIA Parakeet V2, sebuah sistem dengan 600 juta parameter, dan mengembalikan kata‑kata berlabel pembicara beserta waktu, potongan per‑pembicara, serta tanda tumpang tindih. Baseten menyatakan preset ini memasukkan vektor aktivitas per‑pembicara langsung ke lapisan encoder awal Parakeet sehingga ucapan yang tumpang tindih ditranskripsi dalam satu langkah, dengan label pembicara final saat tiba dan kata‑kata yang dikomitmen tidak pernah diubah.
Baseten melaporkan bahwa satu RTX PRO 6000 dapat mempertahankan lebih dari 500 aliran diarization berdurasi satu jam secara bersamaan pada profil 1,04 detik, 200 aliran pada profil 0,32 detik, dan 190 aliran berdurasi satu jam ketika transkripsi ditambahkan, sementara preset batch memproses 200 berkas audio enam menit per menit. Dengan menggunakan berkas dan perangkat keras yang sama, Baseten melaporkan bahwa preset yang dioptimalkan menghasilkan throughput batch kira‑kira 1,35 kali lebih tinggi dibandingkan dengan konfigurasi referensi NVIDIA yang diuji, di bawah beban yang dihasilkan k6 di dalam klaster dengan kontrol satu aliran pada replika yang menganggur.
Baseten juga menyatakan bahwa sinyal aktivitas per‑pembicara model, yang dilacak dalam interval 10 milidetik, dapat menggerakkan deteksi aktivitas suara, deteksi akhir giliran khusus pembicara, serta penanganan giliran dan interupsi, dengan respons kira‑kira 300 milidetik pada pengaturan latensi ultra‑rendah.
Nemotron 3 Diarization tersedia di Hugging Face pada repositori nvidia/Nemotron-3-Diarization dan di Model Library Baseten, dengan integrasi NeMo Framework v3.0 serta dukungan untuk GPU NVIDIA Ampere, Ada Lovelace, Hopper, dan Blackwell.












