Nvidia lança modelo gratuito de diarização Nemotron 3 de 100 milhões de parâmetros, identifica até oito falantes em tempo real
O novo modelo de código aberto atinge uma taxa de erro de diarização de 14,7% e supera seu predecessor em cerca de 41%, segundo o benchmark VoiceArena.
O que a Nvidia anunciou
Em 27 de setembro de 2026, a Nvidia revelou o Nemotron 3 Diarization, um modelo de segmentação de falantes cujos pesos estão disponíveis publicamente. O sistema de 100 milhões de parâmetros pode distinguir até oito falantes simultâneos e sinalizar momentos em que múltiplas vozes se sobrepõem.
Especificações do modelo e desempenho em benchmark
O Nemotron 3 processa fluxos de áudio gravados e ao vivo, atribuindo rótulos genéricos como “speaker_2” a cada voz. Ele pode ser combinado com motores de reconhecimento de fala como o Parakeet para produzir transcrições que incluam tags de falante. O modelo suporta quatro configurações de buffer de áudio, variando de 30,4 segundos a 0,32 segundos; buffers mais curtos geralmente reduzem a precisão.
No VoiceArena Diarization Benchmark v1, o Nemotron 3 alcançou uma taxa de erro de diarização (DER) de 14,7%, posicionando‑se no topo da classificação. No teste mais rigoroso Diarization‑Bench, registrou uma taxa de erro de 14,72%, superando o segundo colocado, que ficou em 19,3%. O benchmark penaliza fala sobreposta e até pequenos desalinhamentos nas trocas de falante. Em comparação com o Streaming Sortformer anterior da Nvidia, o Nemotron 3 reduz o erro em média 41% em oito cenários de teste ao usar um buffer de 1,04 segundo.
Implicações para IA de fala
Ao oferecer um modelo de diarização gratuito e de alto desempenho, a Nvidia reduz a barreira para desenvolvedores que constroem pipelines de transcrição com múltiplos falantes. A capacidade de lidar com até oito falantes e detectar sobreposições o torna adequado para reuniões, podcasts e outros contextos de áudio com várias pessoas, especialmente quando combinado com reconhecedores existentes. Os resultados robustos nos benchmarks sugerem uma mudança rumo a soluções de rastreamento de falantes mais precisas e em tempo real no ecossistema mais amplo de IA de fala.



