Nvidia lanza modelo gratuito de diarización Nemotron 3 de 100 millones de parámetros, identifica hasta ocho hablantes en tiempo real
El nuevo modelo de peso abierto alcanza una tasa de error de diarización del 14,7 % y supera a su predecesor en aproximadamente un 41 %, según el benchmark VoiceArena.
Qué anunció Nvidia
El 27 de septiembre de 2026, Nvidia presentó Nemotron 3 Diarization, un modelo de segmentación de hablantes cuyas pesos están disponibles públicamente. El sistema de 100 millones de parámetros puede distinguir hasta ocho hablantes simultáneos y señalar los momentos en que varias voces se superponen.
Especificaciones del modelo y rendimiento en benchmarks
Nemotron 3 procesa tanto flujos de audio grabados como en tiempo real, asignando etiquetas genéricas como “speaker_2” a cada voz. Puede combinarse con motores de reconocimiento de voz como Parakeet para generar transcripciones que incluyan etiquetas de hablante. El modelo admite cuatro configuraciones de búfer de audio, que van de 30,4 segundos a 0,32 segundos; los búferes más cortos generalmente reducen la precisión.
En el VoiceArena Diarization Benchmark v1, Nemotron 3 alcanzó una tasa de error de diarización (DER) del 14,7 %, situándose en la cima de la tabla de clasificación. En la prueba más estricta Diarization‑Bench, registró un error del 14,72 %, superando al segundo lugar, que obtuvo un 19,3 %. El benchmark penaliza el habla superpuesta e incluso pequeñas desalineaciones en los cambios de hablante. En comparación con el anterior Streaming Sortformer de Nvidia, Nemotron 3 reduce el error en un promedio del 41 % en ocho escenarios de prueba al usar un búfer de 1,04 segundos.
Implicaciones para la IA de voz
Al ofrecer un modelo de diarización gratuito y de alto rendimiento, Nvidia reduce la barrera de entrada para los desarrolladores que construyen pipelines de transcripción con múltiples hablantes. La capacidad de manejar hasta ocho hablantes y detectar superposiciones lo hace adecuado para reuniones, podcasts y otros contextos de audio con varias personas, especialmente cuando se combina con reconocedores existentes. Los sólidos resultados en los benchmarks sugieren un movimiento hacia soluciones de seguimiento de hablantes más precisas y en tiempo real en el ecosistema más amplio de IA de voz.



