NVIDIA lança Nemotron 3 Diarization, modelo de pesos abertos capaz de rastrear até oito interlocutores
A NVIDIA lançou o Nemotron 3 Diarization, um modelo de pesos abertos com 100 milhões de parâmetros que rastreia até oito interlocutores simultâneos em tempo real e em áudios gravados, conquistando o primeiro lugar no Diarization-Bench da VoiceArena.
NVIDIA estreia modelo de diarização com pesos abertos
Em 23 de setembro de 2026, os pesquisadores da NVIDIA Francesco Ciannella, Maryam Motamedi, Taejin Park, Ivan Medennikov e Adi Margolin apresentaram o Nemotron 3 Diarization, um modelo de voz de pesos abertos com 100 milhões de parâmetros desenvolvido para identificar quem falou e quando em conversas com múltiplos participantes. Lançado sob a licença OpenMDW License Agreement v1.1, o modelo foi projetado para ambientes Linux com GPUs NVIDIA Ampere, Hopper ou Blackwell.
O sistema expande a arquitetura anterior Streaming Sortformer de quatro interlocutores da NVIDIA, ampliando o rastreamento simultâneo para oito canais anônimos de locutores. Em testes de benchmark no Diarization-Bench inicial da VoiceArena — que avaliou 139 conversas em inglês totalizando cerca de 22 horas —, o Nemotron 3 Diarization ficou em primeiro lugar entre 12 sistemas avaliados em 17 configurações. Avaliado considerando sobreposição de fala, detecção de atividade de voz gerada pelo sistema e tolerância zero de margem (zero collar tolerance), ele registrou uma Taxa de Erro de Diarização (DER) de 14,72%, superando a DER de 19,3% do segundo colocado por uma margem relativa de 24%.
Arquitetura, benchmarks e desempenho de baixa latência
O Nemotron 3 Diarization processa áudio monocanal de 16 kHz nos formatos .wav, .flac, .opus e .mp3. O áudio de entrada é convertido em características de espectrograma Mel em passos de quadros de 10 ms, agrupados oito vezes em quadros de 80 ms antes de passarem para um codificador Transformer de 31 camadas equipado com Rotary Positional Embeddings (RoPE). Uma camada Conv1D faz o upsampling da saída de volta para intervalos de 10 ms, gerando um tensor de ponto flutuante que rastreia as probabilidades de atividade dos interlocutores em oito canais simultaneamente para preservar a sobreposição de falas.
Para manter identificadores de locutores consistentes durante transmissões em tempo real sem reavaliar permutações a cada novo segmento de entrada, o modelo utiliza um esquema de ordem de chegada baseado no Sortformer. Ele preserva o contexto anterior por meio de um Arrival-Order Speaker Cache (AOSC), uma fila do tipo FIFO (primeiro a entrar, primeiro a sair) para quadros recentes, além de contexto à direita (lookahead) configurável. Os desenvolvedores podem ajustar a latência do buffer de entrada em quatro configurações principais: um modo offline de 30,4 segundos, baixa latência de 1,04 segundo, latência muito baixa de 0,64 segundo e latência ultrabaixa de 0,32 segundo (com suporte teórico a 80 ms, embora 0,32 segundo seja o limite mínimo recomendado).
O treinamento incorporou conjuntos de dados públicos e comerciais, incluindo áudios com múltiplos interlocutores licenciados da David AI, abrangendo fala natural e misturas sintéticas em 21 idiomas. A incorporação dos conjuntos de dados da David AI reduziu a DER composta em 0,77 ponto percentual absoluto, caindo de 11,19% para 10,42%.
Em comparação com o modelo de referência anterior da NVIDIA (diar_streaming_sortformer_4spk-v2.1) em oito benchmarks públicos com um buffer de latência de 1,04 segundo, o novo modelo obteve uma redução média não ponderada de 41,0% relativo na DER. As melhorias variaram de 9,0% no CALLHOME-Part2 até 65,2% no NOTSOFAR1 MHM. No benchmark DIHARD III, a DER caiu de 19,60% para 13,18% com latência de 1,04 segundo e de 19,09% para 12,73% com latência de 30,4 segundos. Testes de vazão de hardware em uma NVIDIA RTX PRO 5000 usando precisão BF16 e torch.compile() com batch size 32 mostraram velocidades de processamento que atingiram uma aceleração do fator de tempo real (RTFx) de 865× a 1,04 segundo de latência e de 15.113× RTFx na configuração offline de 30,4 segundos.
Integrações ao ecossistema e ressalvas para implementação
Como a diarização isolada produz marcadores temporais (timestamps) dos interlocutores em vez de transcrições de fala em texto, os sistemas downstream precisam combinar o modelo com um mecanismo de reconhecimento automático de fala (ASR) — como o Parakeet-TDT 0.6B v3 da NVIDIA ou o Nemotron ASR 3.5 — para gerar o texto atribuído. Parceiros do ecossistema já estão integrando o modelo a fluxos de trabalho especializados: a Argmax incluiu o Nemotron 3 Diarization em seu Argmax Pro SDK 3 para fornecer atribuição em tempo real no dispositivo e uma API de transcrição pré-diarizada, enquanto fluxos de trabalho de implantação em nuvem foram destacados para o Baseten e a DigitalOcean.
A NVIDIA aponta alguns limites operacionais para produção em cenários reais. O Nemotron 3 Diarization limita a atribuição a oito interlocutores; conversas que excedam esse número sofrerão com trechos de fala ignorados ou canais de interlocutores atribuídos incorretamente. Desafios acústicos como reverberação extrema do ambiente, gravações em campo distante (far-field), ruído de fundo ou desvios de domínio significativos também podem provocar confusão entre interlocutores, falsos positivos e imprecisões nos limites das marcações temporais.



