NVIDIA, 최대 8인 화자 분할 지원하는 오픈 가중치 모델 'Nemotron 3 Diarization' 공개
NVIDIA가 실시간 및 녹음 오디오에서 겹치는 발화를 포함해 최대 8명의 화자를 추적할 수 있는 1억 파라미터 규모의 오픈 가중치 모델 'Nemotron 3 Diarization'을 출시하고 VoiceArena의 Diarization-Bench에서 1위를 차지했다.
NVIDIA, 오픈 가중치 화자 분할 모델 출시
2026년 9월 23일, NVIDIA의 Francesco Ciannella, Maryam Motamedi, Taejin Park, Ivan Medennikov, Adi Margolin 연구진은 다자간 대화에서 누가 언제 말했는지를 식별하도록 설계된 1억 파라미터 규모의 오픈 가중치 음성 모델 'Nemotron 3 Diarization'을 공개했다. OpenMDW License Agreement v1.1에 따라 배포된 이 모델은 NVIDIA Ampere, Hopper, Blackwell GPU 기반의 Linux 환경용으로 구축됐다.
이 시스템은 기존 NVIDIA의 4인 화자 지원 Streaming Sortformer 아키텍처를 확장하여 최대 8개의 익명 화자 채널을 동시 추적할 수 있도록 지원한다. 약 22시간 분량의 139개 영어 대화를 평가한 VoiceArena의 첫 Diarization-Bench 벤치마크 테스트에서 Nemotron 3 Diarization은 17개 구성에 걸쳐 평가된 12개 시스템 중 1위를 차지했다. 중복 음성, 시스템 생성 음성 활동 감지(SAD), 제로 칼라 허용 오차(zero collar tolerance) 조건에서 14.72%의 화자 분할 오차율(DER)을 기록하며 2위 시스템의 19.3% DER 대비 상대적으로 24% 앞선 성능을 보였다.
아키텍처, 벤치마크 및 저지연 성능
Nemotron 3 Diarization은 .wav, .flac, .opus, .mp3 형식의 16kHz 단일 채널 오디오를 처리한다. 입력된 오디오는 10ms 프레임 단위의 멜-스펙트로그램(Mel-spectrogram) 특징으로 변환된 후, 8배로 누적되어 80ms 프레임으로 구성된 뒤 회전 위치 임베딩(RoPE)이 적용된 31계층 Transformer 인코더로 전달된다. 이후 Conv1D 계층이 출력을 다시 10ms 간격으로 업샘플링하여, 발화 중복을 보존할 수 있도록 8개 채널 전체의 화자 활동 확률을 동시에 추적하는 부동 소수점 텐서를 출력한다.
라이브 스트리밍 중 입력되는 슬라이스마다 순열을 재평가하지 않고 일관된 화자 ID를 유지하기 위해, 이 모델은 Sortformer 기반의 도착 순서(arrival-order) 방식을 적용했다. 또한 최근 프레임을 위한 선입선출(FIFO) 큐인 도착 순서 화자 캐시(AOSC)와 조절 가능한 미래 컨텍스트 참조(lookahead right context)를 통해 이전 맥락을 유지한다. 개발자는 오프라인 방식의 30.4초, 저지연 1.04초, 초저지연 0.64초, 극저지연 0.32초 등 4가지 주요 구성으로 입력 버퍼 지연 시간을 조정할 수 있다(이론적으로는 80ms까지 지원되나 권장 하한선은 0.32초다).
모델 학습에는 21개 언어에 걸친 자연 음성과 합성 혼합 음성을 망라하는 David AI 라이선스 기반 다자간 오디오를 포함해 공개 및 상용 데이터셋이 활용됐다. David AI 데이터셋 도입을 통해 복합 DER은 절대 수치 기준 0.77%포인트 감소하며 11.19%에서 10.42%로 개선됐다.
1.04초 지연 시간 버퍼 환경에서 8개 공개 벤치마크를 측정한 결과, 신규 모델은 기존 NVIDIA 베이스라인 모델(diar_streaming_sortformer_4spk-v2.1) 대비 DER을 비가중 평균 기준 상대적으로 41.0% 낮췄다. 성능 개선 폭은 CALLHOME-Part2의 9.0%부터 NOTSOFAR1 MHM의 65.2%까지 다양하게 나타났다. DIHARD III 벤치마크에서는 DER이 1.04초 지연 시 19.60%에서 13.18%로, 30.4초 지연 시에는 19.09%에서 12.73%로 감소했다. NVIDIA RTX PRO 5000에서 BF16 정밀도 및 torch.compile()을 적용하고 배치 크기 32로 진행한 하드웨어 처리량 테스트에서는 1.04초 지연 시 865배의 실시간 계수 속도 향상(RTFx)을, 30.4초 오프라인 구성에서는 15,113배의 RTFx를 달성했다.
생태계 연동 및 배포 시 고려사항
단독 화자 분할 모델은 음성 텍스트 변환 결과가 아닌 화자별 타임스탬프를 출력하므로, 발언자가 매칭된 텍스트를 도출하려면 다운스트림 시스템에서 NVIDIA Parakeet-TDT 0.6B v3나 Nemotron ASR 3.5와 같은 자동 음성 인식(ASR) 엔진과 결합해야 한다. 생태계 파트너들은 이미 특화된 워크플로우에 이 모델을 패키징하고 있다. Argmax는 실시간 온디바이스 화자 식별 및 사전 분할된 전사 API를 제공하기 위해 Nemotron 3 Diarization을 자사 Argmax Pro SDK 3에 통합했으며, Baseten 및 DigitalOcean용 클라우드 배포 워크플로우도 소개됐다.
NVIDIA는 실제 상용 환경 배포 시 주의해야 할 몇 가지 운영 제약 사항을 명시했다. Nemotron 3 Diarization의 화자 식별 한도는 최대 8명으로, 이를 초과하는 대화에서는 발화가 누락되거나 화자 채널이 잘못 지정될 수 있다. 또한 극심한 공간 잔향, 원거리 음장 녹음, 배경 소음이나 심한 도메인 변화와 같은 음향적 난관도 화자 혼동, 오탐지, 타임스탬프 경계 오차를 유발할 수 있다.



