Nvidia 發布免費 100M 參數 Nemotron 3 語者分割模型,實時辨識多達八位說話者
根據 VoiceArena 基準測試,這款開放權重模型的語者分割錯誤率為 14.7%,較前代提升約 41%。
Nvidia 宣佈
2026 年 9 月 27 日,Nvidia 推出 Nemotron 3 Diarization,這是一款公開權重的說話者分割模型。這套 1 億參數的系統可同時辨識多達八位說話者,並標示出多聲重疊的時刻。
模型規格與基準表現
Nemotron 3 能處理錄製與即時音訊串流,為每個聲音指派通用標籤,例如「speaker_2」。它可與如 Parakeet 等語音辨識引擎結合,產生包含說話者標記的文字稿。模型支援四種音訊緩衝設定,從 30.4 秒降至 0.32 秒;緩衝時間較短通常會降低準確度。
在 VoiceArena Diarization Benchmark v1 中,Nemotron 3 的語者分割錯誤率(DER)為 14.7%,位居排行榜首位。於更嚴格的 Diarization‑Bench 測試中,其錯誤率為 14.72%,超過第二名的 19.3%。此基準會對重疊語音以及說話者切換時的微小錯位進行懲罰。與 Nvidia 先前的 Streaming Sortformer 相比,Nemotron 3 在使用 1.04 秒緩衝時,於八項測試情境中平均降低錯誤率約 41%。
對語音 AI 的影響
Nvidia 提供免費且高效能的語者分割模型,降低了開發者建置多說話者文字轉錄管線的門檻。能處理多達八位說話者並偵測語音重疊的能力,使其適用於會議、播客及其他多方音訊情境,尤其結合現有辨識引擎時更顯優勢。優異的基準成績顯示,整體 AI 語音生態正朝向更精確、即時的說話者追蹤解決方案發展。



