Nvidia, 무료 1억 파라미터 Nemotron 3 다이어리제이션 모델 공개…실시간으로 최대 8명 화자 식별
새로운 오픈 웨이트 모델이 VoiceArena 벤치마크에서 14.7% 다이어리제이션 오류율을 기록했으며, 전 모델보다 약 41% 향상된 것으로 나타났다.
Nvidia가 발표한 내용
2026년 9월 27일, Nvidia는 가중치를 공개한 화자 분할 모델인 Nemotron 3 Diarization을 공개했다. 1억 파라미터 규모의 이 시스템은 동시에 최대 8명의 화자를 구분하고, 여러 목소리가 겹치는 순간을 표시할 수 있다.
모델 사양 및 벤치마크 성능
Nemotron 3은 녹음된 오디오와 실시간 스트림을 모두 처리하며, 각 음성에 “speaker_2”와 같은 일반 라벨을 부여한다. Parakeet와 같은 음성 인식 엔진과 결합하면 화자 태그가 포함된 전사를 생성할 수 있다. 이 모델은 30.4초에서 0.32초까지 네 가지 오디오 버퍼 구성을 지원하는데, 버퍼가 짧아질수록 일반적으로 정확도가 낮아진다.
VoiceArena Diarization Benchmark v1에서 Nemotron 3은 14.7%의 다이어리제이션 오류율(DER)을 기록해 리더보드 1위를 차지했다. 보다 엄격한 Diarization‑Bench 테스트에서는 14.72% 오류율을 보였으며, 2위인 19.3%보다 앞섰다. 이 벤치마크는 겹치는 발화와 화자 전환 시의 사소한 정렬 오류까지도 페널티를 부과한다. Nvidia의 이전 모델인 Streaming Sortformer와 비교했을 때, Nemotron 3은 1.04초 버퍼를 사용할 경우 8개 테스트 시나리오에서 평균 41% 오류 감소 효과를 보였다.
음성 AI에 미치는 영향
무료이면서 고성능의 다이어리제이션 모델을 제공함으로써 Nvidia는 다중 화자 전사 파이프라인을 구축하려는 개발자들의 진입 장벽을 낮춘다. 최대 8명의 화자를 처리하고 겹치는 발화를 감지할 수 있는 능력은 회의, 팟캐스트 및 기타 다자 오디오 환경에 적합하며, 기존 인식 엔진과 결합하면 더욱 효과적이다. 뛰어난 벤치마크 결과는 AI‑음성 분야 전반에서 보다 정확하고 실시간 화자 추적 솔루션으로의 전환이 가속화될 가능성을 시사한다.



