AI RACE— The AI Race
New Models

Nvidia、無料の100Mパラメータ Nemotron 3 ダイアリゼーションモデルを発表、リアルタイムで最大8人の話者を識別

新しいオープンウェイトモデルはVoiceArenaベンチマークで14.7%のダイアリゼーションエラー率を記録し、前世代比で約41%性能向上した。

2026/09/27 18:01
New Models

Nvidiaが発表した内容

2026年9月27日、NvidiaはNemotron 3 Diarizationを発表した。このスピーカーセグメンテーションモデルは重みが公開されており、1億パラメータのシステムは同時に最大8人の話者を区別でき、複数の声が重なる瞬間を検出できる。

モデル仕様とベンチマーク性能

Nemotron 3は録音音声とリアルタイム音声の両方を処理し、各声に「speaker_2」などの汎用ラベルを付与する。Parakeetなどの音声認識エンジンと組み合わせることで、話者タグ付きの文字起こしを生成できる。モデルは30.4秒から0.32秒までの4種類のオーディオバッファ構成をサポートしており、バッファが短くなるほど精度は低下する傾向がある。

VoiceArena Diarization Benchmark v1において、Nemotron 3はダイアリゼーションエラー率(DER)14.7%を達成し、リーダーボードの首位に立った。より厳格なDiarization‑Benchテストでは14.72%のエラー率を記録し、2位の19.3%を大きく上回った。このベンチマークは重複音声や話者切り替え時の微小なずれにもペナルティを課す。Nvidiaの従来モデルであるStreaming Sortformerと比較すると、1.04秒バッファ使用時に8つのテストシナリオで平均41%のエラー削減が確認された。

音声AIへの影響

無料で高性能なダイアリゼーションモデルを提供することで、Nvidiaはマルチスピーカー文字起こしパイプラインを構築する開発者のハードルを下げた。最大8人の話者を扱い、重複を検出できる点は会議やポッドキャスト、その他のマルチパーティ音声シーンに適しており、既存の認識エンジンと組み合わせることで特に有効である。ベンチマークでの優れた結果は、AI音声エコシステム全体でより正確かつリアルタイムな話者追跡ソリューションへの移行が進むことを示唆している。

関連記事