AI RACE— The AI Race
New Models

NVIDIA、最大8人の話者を追跡するオープンウェイトモデル「Nemotron 3 Diarization」を公開

NVIDIAは、リアルタイムおよび録音音声において最大8人の重複発話を追跡できる1億パラメータのオープンウェイトモデル「Nemotron 3 Diarization」を公開し、VoiceArenaのDiarization-Benchで首位を獲得した。

2026/09/23 20:17
New Models

NVIDIA、オープンウェイトの話者分離モデルを発表

2026年9月23日、NVIDIAの研究者であるFrancesco Ciannella、Maryam Motamedi、Taejin Park、Ivan Medennikov、Adi Margolinの各氏は、複数人の会話において「誰がいつ話したか」を特定する1億パラメータのオープンウェイト音声モデル「Nemotron 3 Diarization」を発表した。OpenMDW License Agreement v1.1の下でリリースされた同モデルは、NVIDIA Ampere、Hopper、またはBlackwell GPUを搭載したLinux環境向けに構築されている。

このシステムは、NVIDIAの従来の4話者対応Streaming Sortformerアーキテクチャを拡張し、最大8つの匿名話者チャンネルの同時追跡に対応させたものだ。約22時間に及ぶ139の英語会話を評価したVoiceArenaの初代「Diarization-Bench」におけるベンチマークテストにおいて、Nemotron 3 Diarizationは17の構成・12システムの中で1位を獲得した。発話の重複、システム生成の発話区間検出、カラー許容誤差ゼロ(zero collar tolerance)という条件下で評価され、ダイアライゼーション誤り率(DER)は14.72%を記録。2位のシステムの19.3%というDERを相対差で24%上回る成績を収めた。

アーキテクチャ、ベンチマーク、そして低遅延性能

Nemotron 3 Diarizationは、.wav、.flac、.opus、.mp3形式の16 kHzモノラル音声を処理する。入力音声は10 msのフレームステップでメルスペクトログラム特徴量に変換され、8フレーム分スタックされて80 msのフレームとなった後、Rotary Positional Embeddings(RoPE)を備えた31層のTransformerエンコーダに渡される。その後、Conv1D層によって出力が再び10 ms間隔にアップサンプリングされ、発話の重複を保持しながら8チャンネル同時に話者の発話確率を追跡する浮動小数点テンソルが出力される。

ライブストリーミング中に入力スライスごとに順列を再評価することなく一貫した話者IDを維持するため、同モデルはSortformerベースの発話開始順(arrival-order)スキームを採用している。直近フレーム用の先入れ先出し(FIFO)キューであるArrival-Order Speaker Cache(AOSC)と、設定可能なルックアヘッド右コンテキストを通じて過去の文脈を保持する。開発者は入力バッファの遅延を主に4つの構成で調整可能だ。オフライン向けの30.4秒、低遅延の1.04秒、極低遅延の0.64秒、超低遅延の0.32秒である(理論上は80 msもサポートされているが、推奨される下限は0.32秒)。

学習には公開および商用データセットが活用されており、これには21言語にわたる自然音声および合成混合音声を含むDavid AIからライセンス提供されたマルチスピーカー音声が含まれる。David AIのデータセットを組み込んだことで、複合DERは絶対値で0.77ポイント削減され、11.19%から10.42%へと低下した。

8つの公開ベンチマークにおいて1.04秒のレイテンシバッファでNVIDIAの従来のベースラインモデル(diar_streaming_sortformer_4spk-v2.1)と比較したところ、新モデルはDERで平均41.0%の相対的な削減(非加重平均)を達成した。改善率は「CALLHOME-Part2」の9.0%から「NOTSOFAR1 MHM」の65.2%に及ぶ。「DIHARD III」ベンチマークでは、1.04秒のレイテンシでDERが19.60%から13.18%に、30.4秒のレイテンシでは19.09%から12.73%へと低下した。BF16精度とtorch.compile()を使用し、バッチサイズ32でNVIDIA RTX PRO 5000上で実施したハードウェアスループットテストでは、1.04秒のレイテンシで865倍のRTFx(リアルタイムファクタ倍率)、30.4秒のオフライン構成では1万5113倍のRTFxを記録した。

エコシステムの統合と運用の留意点

単体のダイアライゼーションは文字起こしではなく話者のタイムスタンプのみを生成するため、発言者を特定したテキストを生成するには、下流システムでNVIDIAの「Parakeet-TDT 0.6B v3」や「Nemotron ASR 3.5」などの自動音声認識(ASR)エンジンと組み合わせる必要がある。エコシステムパートナーはすでに特化型ワークフロー向けに同モデルの組み込みを進めている。ArgmaxはNemotron 3 Diarizationを自社の「Argmax Pro SDK 3」に統合し、リアルタイムのオンデバイス話者帰属および事前ダイアライゼーション済み文字起こしAPIを提供しているほか、BasetenやDigitalOcean向けのクラウドデプロイメントワークフローも提示されている。

NVIDIAは、実際の商用環境におけるいくつかの運用上の制約を挙げている。Nemotron 3 Diarizationが帰属できる話者数は最大8人に制限されており、それを超える会話では発話の聞き逃しや話者チャンネルの誤割り当てが発生する。また、極端な室内残響、遠距離録音、バックグラウンドノイズ、大幅なドメインシフトなどの音響的課題も、話者の取り違えや誤検出、タイムスタンプ境界の不正確さにつながる可能性がある。

関連記事