NVIDIA 推出開放權重模型 Nemotron 3 Diarization,最多可追蹤 8 位語者
NVIDIA 推出擁有 1 億參數的開放權重模型 Nemotron 3 Diarization,可在即時串流與錄製音訊中追蹤多達 8 位重疊語者,並在 VoiceArena 的 Diarization-Bench 基準測試中榮登榜首。
NVIDIA 發表開放權重語者分離模型
2026 年 9 月 23 日,NVIDIA 研究人員 Francesco Ciannella、Maryam Motamedi、Taejin Park、Ivan Medennikov 與 Adi Margolin 發表了 Nemotron 3 Diarization。這是一款擁有 1 億參數的開放權重語音模型,旨在辨識多人對話中「誰在何時說了話」。該模型以 OpenMDW License Agreement v1.1 授權釋出,專為搭載 NVIDIA Ampere、Hopper 或 Blackwell GPU 的 Linux 環境打造。
該系統奠基於 NVIDIA 先前的四語者 Streaming Sortformer 架構,將同時追蹤能力拓展至 8 個匿名語者聲道。在 VoiceArena 首波 Diarization-Bench 基準測試(評估 139 段英文對話、總長度約 22 小時)中,Nemotron 3 Diarization 在 12 款系統的 17 種組態中拔得頭籌。在計入語音重疊、系統自動語音活動偵測及零容許誤差區間(zero collar tolerance)的嚴格評分下,該模型繳出 14.72% 的語者分離錯誤率(DER),相較於第二名系統的 19.3% DER,展現出 24% 的相對優勢。
架構設計、基準測試與低延遲表現
Nemotron 3 Diarization 支援 16 kHz 單聲道音訊,涵蓋 .wav、.flac、.opus 與 .mp3 等格式。輸入的音訊會以 10 毫秒(ms)為步長轉換為梅爾頻譜(Mel-spectrogram)特徵,隨後進行 8 倍堆疊成 80 ms 的訊框,再送入配備旋轉位置編碼(RoPE)的 31 層 Transformer 編碼器中處理。接著由 Conv1D 層將輸出上採樣回 10 ms 間隔,產出浮點張量,同時追蹤 8 個聲道的語者活動機率,進而精準保留語音重疊資訊。
為了在即時串流中維持語者 ID 的一致性,且無須對每個傳入的音訊切片重新計算排列組合,該模型採用了基於 Sortformer 的登場順序方案(arrival-order scheme)。它透過登場順序語者快取(Arrival-Order Speaker Cache, AOSC)、針對近期訊框的先進先出(FIFO)佇列,以及可自訂的右側前瞻上下文(lookahead right context)來保留先前的背景資訊。開發者可在四種主要組態中調整輸入緩衝區延遲:離線模式的 30.4 秒、低延遲的 1.04 秒、極低延遲的 0.64 秒,以及超低延遲的 0.32 秒(理論上支援 80 ms,但官方建議最低門檻為 0.32 秒)。
訓練過程結合了公開與商業資料集,其中包括來自 David AI 授權的多語者音訊,涵蓋 21 種語言的自然語音與合成混合音訊。導入 David AI 資料集後,複合 DER 絕對值降低了 0.77 個百分點,由 11.19% 降至 10.42%。
在 1.04 秒延遲緩衝設定下,相較於 NVIDIA 先前的基準模型(diar_streaming_sortformer_4spk-v2.1),新模型在 8 項公開基準測試中的非加權 DER 相對降幅平均達 41.0%。提升幅度從 CALLHOME-Part2 的 9.0% 到 NOTSOFAR1 MHM 的 65.2% 不等。在 DIHARD III 基準測試中,1.04 秒延遲下的 DER 從 19.60% 降至 13.18%,30.4 秒延遲下則從 19.09% 降至 12.73%。在 NVIDIA RTX PRO 5000 上使用 BF16 精度與 torch.compile()、批次大小(batch size)為 32 的硬體吞吐量測試顯示,1.04 秒延遲時的處理速度達到 865 倍即時率(RTFx),而在 30.4 秒離線組態下更達到 15,113 倍 RTFx。
生態系整合與部署限制
由於獨立的語者分離模型僅產生語者時間戳記,而非語音轉文字的逐字稿,因此下游系統必須將該模型與自動語音辨識(ASR)引擎搭配——例如 NVIDIA 的 Parakeet-TDT 0.6B v3 或 Nemotron ASR 3.5——才能產出標註發言者的文字內容。生態系合作夥伴已開始將此模型封裝至專業工作流中:Argmax 將 Nemotron 3 Diarization 整合至其 Argmax Pro SDK 3,提供即時裝置端語者歸屬辨識與預先分離的轉錄 API;雲端部署工作流方面,官方則特別介紹了 Baseten 與 DigitalOcean 的解決方案。
NVIDIA 也指出了實際正式上線時的幾項運作限制。Nemotron 3 Diarization 最多僅支援 8 位語者歸屬辨識,若對話人數超過上限,將會出現語音遺漏或聲道分配錯誤的情況。此外,極端空間殘響、遠場收音、背景雜訊或顯著的領域偏移等聲學挑戰,也可能導致語者混淆、虛警(false alarms)以及時間戳記邊界失真。



