AIモデルとプラットフォーム

NVIDIA、Nemotron 3 Diarization オープンウェイトスピーカーモデルを発表

mm
Unite.AI を Google の優先ソースに追加

NVIDIAは2026年9月23日に、ライブまたは録音オーディオで最大8人の話者を識別できるオープンウェイトのスピーカーダイアリゼーションモデル「Nemotron 3 Diarization」をリリースし、Basetenは同日、バッチ、ストリーミング、ダイアリゼーション付き文字起こしの各プリセットがRTX PRO 6000 GPU 1台で実行されるサービングサポートを発表した。

スピーカーダイアリゼーションは、各話者が発話している時間帯で音声ストリームを分割し、各声のタイミングを出力し、すべての区間に一貫したラベルを付与します。文字起こしと組み合わせることで、文字起こしされた単語を発話した人物に紐付けます。Basetenの発表では、Nemotron 3 Diarization が従来のセグメンテーション+埋め込みパイプラインとそのチューニングを単一パスで置き換えるオープンでエンドツーエンドのモデルであり、話者ラベル付けの間隔を最小で320ミリ秒まで設定可能と説明されています。

アーキテクチャとレイテンシプロファイル

NVIDIAのモデルカードによると、このモデルは実世界のオーディオで「誰がいつ話したか」を判定するよう設計されており、ストリーミングとオフライン推論の両方をサポートし、商用・非商用を問わず使用できるとされています。パラメータ数1億、層数31のTransformerエンコーダで、ロータリーポジショナルエンベディングを使用しています。入力される16kHzの単一チャネル音声は、10ミリ秒のメルスペクトログラムフレームに変換され、8倍にダウンサンプリングされて80ミリ秒のエンコーダフレームレートになります。エンコーダ上部のConv1D層が予測を再び10ミリ秒の入力解像度にアップサンプリングします。モデルは形状が T × 8 のテンソルで、話者ごとの活動確率を出力し、8つの話者チャンネルは音声中で最初に現れた順に並べられます。

ストリーミング時には、NVIDIAのStreaming Sortformerで導入されたArrival-Order Speaker Cache と FIFO キューを使用します。キャッシュは以前のチャンクからの話者情報を保持し、最初に聞こえた声のラベルを維持します。一方、キューは各処理ステップに最近のフレームコンテキストを提供します。この設計は埋め込みやクラスタリングを必要とせず、チャンク単位の推論は音声の長さに固定的な制限を設けません。

単一のチェックポイントで、0.32秒、0.64秒、1.04秒の3つのレイテンシ構成と、オフライン形式の30.4秒入力バッファの計4つの推奨レイテンシ設定に対応します。カードではこのレイテンシを入力バッファレイテンシ(チャンク長+右側コンテキストを80ミリ秒で乗算したもの)として定義し、計算処理時間は含まれないことを明記しています。チェックポイントは最小80ミリ秒のバッファでも実行可能ですが、0.32秒が最小の推奨構成であり、出力フレーム解像度は10ミリ秒単位で設定可能です。

報告された精度と速度

NVIDIAのモデルカードは、ダイアリゼーションエラーレート、話者数カウント精度、話者数カウントの平均絶対誤差をベースラインに対して報告しています diar_streaming_sortformer_4spk-v2.1 ベースラインは、重複音声を含み、すべてのベンチマークでゼロ秒のコラ(許容範囲)を使用していますが、CALLHOME-Part2 だけは0.25秒のコラを使用しています。DIHARD III では、30.4秒プロファイルで全体エラーレートが12.73、0.32秒プロファイルで13.55 と報告され、ベースラインはそれぞれ19.09 と19.85 です。NOTSOFAR1 の単一チャネル録音ではオフラインプロファイルで11.00 対 30.49、AMI Test SDM では11.14 対 21.42、AliMeeting Test Near では6.40 対 11.57、CALLHOME-Part2 では9.10 対 10.32 と報告されています。カードは、AMI、AliMeeting、NOTSOFAR1 のスコアは強制アラインメント参照ラベルで算出され、異なる参照アノテーションで評価された結果は直接比較できないと述べています。

カード内の速度表では、リアルタイムファクター(総音声時間 ÷ 総処理時間)として、イーガーモードで1,340、オフラインプロファイルでバッチサイズ1でコンパイル時に4,385 が RTX PRO 5000 の BF16 精度で測定されたと報告されています。0.32秒プロファイルでは、対応する数値はそれぞれ12.5 と 54 です。

Basetenは独自の評価を実施し、重複音声を含みコラなしでエラーレートを算出しました。低レイテンシプロファイルで AISHELL-4 に対して 9.8% のエラーレートを示し、Streaming Sortformer v2.1 の 27.2% と比較しています。また、30秒オフラインプロファイルから0.32秒の超低レイテンシプロファイルへ移行してもエラーレートはわずか1〜2ポイント上昇するだけだと述べています。Basetenは、モデルがテストしたすべてのデータセットで Meta Muse Voice Transcribe を上回り、超低構成でも優れた性能を示したが、AMI に限っては pyannote community-1 に劣ったと報告しています。

学習データとライセンス

モデルカードには、実際の会話約10,000時間(Fisher English、AMI と ICSI の会議コーパス、VoxConverse、AISHELL-4、AliMeeting、第三回 DIHARD チャレンジ、CALLHOME、NOTSOFAR1、DISPLACE セット、ライセンス取得済み David AI 録音、そして疑似ラベル付けされた YODAS‑v2 サブセットを含む)が記載されており、これに加えて約28,000時間の単一話者録音から FastMSS ツールキットでシミュレートされたマルチスピーカー混合音声 82,611 時間が含まれます。トレーニングは NEST の自己教師ありチェックポイントから開始され、8 台のノード(各ノードに 8 枚の A100‑80GB GPU)で二段階にわたり実施されました:シミュレートデータでのオフライン学習、続いて実音とシミュレート音声の組み合わせによるストリーミング微調整です。モデルの使用は OpenMDW License Agreement, version 1.1 に従います。

Baseten のサービングプリセットと容量

Basetenは、RTX PRO 6000 1台上で動作し、NVIDIAのNeMoストリーミングループを中心に構築されたCUDAグラフエンジンの背後で、3つのプリセットを通じてモデルを提供しています。そのモデルライブラリの掲載によると、このモデルはStreaming Sortformer v2 の後継と記述されています。Batch Diarization プリセットは、録音音声用の HTTP エンドポイントで、リクエストごとのレイテンシプロファイルとともに話者ターンを返します。Streaming Diarization は、ライブ音声用の WebSocket エンドポイントで、再クラスタリングせずに会話中の話者IDを保持します。Streaming Diarized Transcription は、ダイアライザーを NVIDIA の Parakeet V2 音声認識モデル(6億パラメータ)と組み合わせ、タイミング付きの話者タグ付き単語、話者別の部分結果、重複フラグを返します。Baseten は、このプリセットが話者ごとの活動ベクトルを直接 Parakeet の初期エンコーダ層に入力し、重なった音声を単一パスで文字起こしし、話者ラベルは到着時に確定し、確定した単語は二度と修正されないと述べています。

Basetenによると、RTX PRO 6000 1台で、1.04秒プロファイルでは500以上の同時1時間長さのダイアライゼーションストリーム、0.32秒プロファイルでは200ストリーム、文字起こしを追加した場合は190の1時間ストリームを維持でき、バッチプリセットは1分間に200本の6分音声ファイルを処理します。同一のファイルとハードウェアを使用し、Basetenは最適化されたプリセットがテストしたNVIDIAのリファレンス構成よりも約1.35倍高いバッチスループットを、クラスター内でk6が生成した負荷下で、アイドルレプリカ上の単一ストリーム制御とともに提供したと報告しています。

Basetenはさらに、10ミリ秒単位で追跡される話者ごとの活動信号が、音声活動検出、話者別のターン終了検出、ターン取りや割り込み処理を駆動でき、超低遅延設定では約300ミリ秒で応答すると述べています。

Nemotron 3 Diarization は、リポジトリ nvidia/Nemotron-3-Diarization として Hugging Face で、また Baseten の Model Library でも利用可能で、NeMo Framework v3.0 の統合と NVIDIA Ampere、Ada Lovelace、Hopper、Blackwell GPU のサポートが提供されています。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。