AIモデルとプラットフォーム
NVIDIA、Nemotron 3 Diarization オープンウェイトスピーカーモデルを発表

NVIDIAは2026年9月23日に、ライブまたは録音オーディオで最大8人の話者を識別できるオープンウェイトのスピーカーダイアリゼーションモデル「Nemotron 3 Diarization」をリリースし、Basetenは同日、バッチ、ストリーミング、ダイアリゼーション付き文字起こしの各プリセットがRTX PRO 6000 GPU 1台で実行されるサービングサポートを発表した。
スピーカーダイアリゼーションは、各話者が発話している時間帯で音声ストリームを分割し、各声のタイミングを出力し、すべての区間に一貫したラベルを付与します。文字起こしと組み合わせることで、文字起こしされた単語を発話した人物に紐付けます。Basetenの発表では、Nemotron 3 Diarization が従来のセグメンテーション+埋め込みパイプラインとそのチューニングを単一パスで置き換えるオープンでエンドツーエンドのモデルであり、話者ラベル付けの間隔を最小で320ミリ秒まで設定可能と説明されています。
アーキテクチャとレイテンシプロファイル
NVIDIAのモデルカードによると、このモデルは実世界のオーディオで「誰がいつ話したか」を判定するよう設計されており、ストリーミングとオフライン推論の両方をサポートし、商用・非商用を問わず使用できるとされています。パラメータ数1億、層数31のTransformerエンコーダで、ロータリーポジショナルエンベディングを使用しています。入力される16kHzの単一チャネル音声は、10ミリ秒のメルスペクトログラムフレームに変換され、8倍にダウンサンプリングされて80ミリ秒のエンコーダフレームレートになります。エンコーダ上部のConv1D層が予測を再び10ミリ秒の入力解像度にアップサンプリングします。モデルは形状が T × 8 のテンソルで、話者ごとの活動確率を出力し、8つの話者チャンネルは音声中で最初に現れた順に並べられます。
ストリーミング時には、NVIDIAのStreaming Sortformerで導入されたArrival-Order Speaker Cache と FIFO キューを使用します。キャッシュは以前のチャンクからの話者情報を保持し、最初に聞こえた声のラベルを維持します。一方、キューは各処理ステップに最近のフレームコンテキストを提供します。この設計は埋め込みやクラスタリングを必要とせず、チャンク単位の推論は音声の長さに固定的な制限を設けません。
単一のチェックポイントで、0.32秒、0.64秒、1.04秒の3つのレイテンシ構成と、オフライン形式の30.4秒入力バッファの計4つの推奨レイテンシ設定に対応します。カードではこのレイテンシを入力バッファレイテンシ(チャンク長+右側コンテキストを80ミリ秒で乗算したもの)として定義し、計算処理時間は含まれないことを明記しています。チェックポイントは最小80ミリ秒のバッファでも実行可能ですが、0.32秒が最小の推奨構成であり、出力フレーム解像度は10ミリ秒単位で設定可能です。
報告された精度と速度
NVIDIAのモデルカードは、ダイアリゼーションエラーレート、話者数カウント精度、話者数カウントの平均絶対誤差をベースラインに対して報告しています diar_streaming_sortformer_4spk-v2.1 ベースラインは、重複音声を含み、すべてのベンチマークでゼロ秒のコラ(許容範囲)を使用していますが、CALLHOME-Part2 だけは0.25秒のコラを使用しています。DIHARD III では、30.4秒プロファイルで全体エラーレートが12.73、0.32秒プロファイルで13.55 と報告され、ベースラインはそれぞれ19.09 と19.85 です。NOTSOFAR1 の単一チャネル録音ではオフラインプロファイルで11.00 対 30.49、AMI Test SDM では11.14 対 21.42、AliMeeting Test Near では6.40 対 11.57、CALLHOME-Part2 では9.10 対 10.32 と報告されています。カードは、AMI、AliMeeting、NOTSOFAR1 のスコアは強制アラインメント参照ラベルで算出され、異なる参照アノテーションで評価された結果は直接比較できないと述べています。
カード内の速度表では、リアルタイムファクター(総音声時間 ÷ 総処理時間)として、イーガーモードで1,340、オフラインプロファイルでバッチサイズ1でコンパイル時に4,385 が RTX PRO 5000 の BF16 精度で測定されたと報告されています。0.32秒プロファイルでは、対応する数値はそれぞれ12.5 と 54 です。
Basetenは独自の評価を実施し、重複音声を含みコラなしでエラーレートを算出しました。低レイテンシプロファイルで AISHELL-4 に対して 9.8% のエラーレートを示し、Streaming Sortformer v2.1 の 27.2% と比較しています。また、30秒オフラインプロファイルから0.32秒の超低レイテンシプロファイルへ移行してもエラーレートはわずか1〜2ポイント上昇するだけだと述べています。Basetenは、モデルがテストしたすべてのデータセットで Meta Muse Voice Transcribe を上回り、超低構成でも優れた性能を示したが、AMI に限っては pyannote community-1 に劣ったと報告しています。
学習データとライセンス
モデルカードには、実際の会話約10,000時間(Fisher English、AMI と ICSI の会議コーパス、VoxConverse、AISHELL-4、AliMeeting、第三回 DIHARD チャレンジ、CALLHOME、NOTSOFAR1、DISPLACE セット、ライセンス取得済み David AI 録音、そして疑似ラベル付けされた YODAS‑v2 サブセットを含む)が記載されており、これに加えて約28,000時間の単一話者録音から FastMSS ツールキットでシミュレートされたマルチスピーカー混合音声 82,611 時間が含まれます。トレーニングは NEST の自己教師ありチェックポイントから開始され、8 台のノード(各ノードに 8 枚の A100‑80GB GPU)で二段階にわたり実施されました:シミュレートデータでのオフライン学習、続いて実音とシミュレート音声の組み合わせによるストリーミング微調整です。モデルの使用は OpenMDW License Agreement, version 1.1 に従います。
Baseten のサービングプリセットと容量
Basetenは、RTX PRO 6000 1台上で動作し、NVIDIAのNeMoストリーミングループを中心に構築されたCUDAグラフエンジンの背後で、3つのプリセットを通じてモデルを提供しています。そのモデルライブラリの掲載によると、このモデルはStreaming Sortformer v2 の後継と記述されています。Batch Diarization プリセットは、録音音声用の HTTP エンドポイントで、リクエストごとのレイテンシプロファイルとともに話者ターンを返します。Streaming Diarization は、ライブ音声用の WebSocket エンドポイントで、再クラスタリングせずに会話中の話者IDを保持します。Streaming Diarized Transcription は、ダイアライザーを NVIDIA の Parakeet V2 音声認識モデル(6億パラメータ)と組み合わせ、タイミング付きの話者タグ付き単語、話者別の部分結果、重複フラグを返します。Baseten は、このプリセットが話者ごとの活動ベクトルを直接 Parakeet の初期エンコーダ層に入力し、重なった音声を単一パスで文字起こしし、話者ラベルは到着時に確定し、確定した単語は二度と修正されないと述べています。
Basetenによると、RTX PRO 6000 1台で、1.04秒プロファイルでは500以上の同時1時間長さのダイアライゼーションストリーム、0.32秒プロファイルでは200ストリーム、文字起こしを追加した場合は190の1時間ストリームを維持でき、バッチプリセットは1分間に200本の6分音声ファイルを処理します。同一のファイルとハードウェアを使用し、Basetenは最適化されたプリセットがテストしたNVIDIAのリファレンス構成よりも約1.35倍高いバッチスループットを、クラスター内でk6が生成した負荷下で、アイドルレプリカ上の単一ストリーム制御とともに提供したと報告しています。
Basetenはさらに、10ミリ秒単位で追跡される話者ごとの活動信号が、音声活動検出、話者別のターン終了検出、ターン取りや割り込み処理を駆動でき、超低遅延設定では約300ミリ秒で応答すると述べています。
Nemotron 3 Diarization は、リポジトリ nvidia/Nemotron-3-Diarization として Hugging Face で、また Baseten の Model Library でも利用可能で、NeMo Framework v3.0 の統合と NVIDIA Ampere、Ada Lovelace、Hopper、Blackwell GPU のサポートが提供されています。












