NVIDIA lanza Nemotron 3 Diarization, un modelo de pesos abiertos que rastrea hasta ocho hablantes
NVIDIA ha lanzado Nemotron 3 Diarization, un modelo de pesos abiertos de 100 millones de parámetros que rastrea hasta ocho hablantes simultáneos en tiempo real y en grabaciones, alcanzando el primer puesto en el Diarization-Bench de VoiceArena.
NVIDIA estrena un modelo de diarización de pesos abiertos
El 23 de septiembre de 2026, los investigadores de NVIDIA Francesco Ciannella, Maryam Motamedi, Taejin Park, Ivan Medennikov y Adi Margolin presentaron Nemotron 3 Diarization, un modelo de voz de pesos abiertos y 100 millones de parámetros diseñado para identificar quién habló y cuándo en conversaciones entre varias personas. Publicado bajo la licencia OpenMDW License Agreement v1.1, el modelo está diseñado para entornos Linux que operen con GPU NVIDIA Ampere, Hopper o Blackwell.
El sistema amplía la arquitectura previa Streaming Sortformer para cuatro hablantes de NVIDIA al extender el seguimiento simultáneo a ocho canales de hablantes anónimos. En las pruebas de rendimiento del benchmark inicial Diarization-Bench de VoiceArena —que evaluó 139 conversaciones en inglés con una duración aproximada de 22 horas—, Nemotron 3 Diarization obtuvo el primer puesto entre 12 sistemas evaluados a lo largo de 17 configuraciones. Evaluado con solapamiento de voz, detección de actividad vocal generada por el sistema y una tolerancia de collar de cero (zero collar tolerance), registró una tasa de error de diarización (DER) del 14,72 %, superando por un margen relativo del 24 % al sistema en segundo lugar, que obtuvo un 19,3 % de DER.
Arquitectura, benchmarks y rendimiento de baja latencia
Nemotron 3 Diarization procesa audio monocanal a 16 kHz en formatos .wav, .flac, .opus y .mp3. El audio entrante se convierte en características de espectrograma de Mel en intervalos de tramas de 10 ms, las cuales se apilan de forma óctuple en tramas de 80 ms antes de pasar a un codificador Transformer de 31 capas equipado con Rotary Positional Embeddings (RoPE). Una capa Conv1D sobremuestrea la salida de vuelta a intervalos de 10 ms, generando un tensor de punto flotante que rastrea las probabilidades de actividad de los hablantes a través de ocho canales simultáneamente para preservar el solapamiento del habla.
Para mantener identidades de hablante coherentes durante la transmisión en vivo sin recalcular permutaciones en cada fragmento entrante, el modelo utiliza un esquema de orden de llegada basado en Sortformer. Conserva el contexto previo mediante una caché de hablantes por orden de llegada (AOSC), una cola FIFO (primero en entrar, primero en salir) para tramas recientes y un contexto a la derecha configurable (lookahead). Los desarrolladores pueden ajustar la latencia del búfer de entrada en cuatro configuraciones principales: un modo fuera de línea de 30,4 segundos, una latencia baja de 1,04 segundos, una latencia muy baja de 0,64 segundos y una latencia ultrabaja de 0,32 segundos (con soporte teórico para 80 ms, aunque 0,32 segundos es el límite mínimo recomendado).
El entrenamiento incorporó conjuntos de datos públicos y comerciales, incluido audio multihablante con licencia de David AI que abarca tanto habla natural como mezclas sintéticas en 21 idiomas. La integración de los conjuntos de datos de David AI redujo el DER compuesto en 0,77 puntos absolutos, pasando del 11,19 % al 10,42 %.
En comparación con el modelo base anterior de NVIDIA (diar_streaming_sortformer_4spk-v2.1) en ocho benchmarks públicos con un búfer de latencia de 1,04 segundos, el nuevo modelo promedió una reducción relativa no ponderada del 41,0 % en el DER. Las mejoras oscilaron entre el 9,0 % en CALLHOME-Part2 y el 65,2 % en NOTSOFAR1 MHM. En el benchmark DIHARD III, el DER disminuyó del 19,60 % al 13,18 % con una latencia de 1,04 segundos y del 19,09 % al 12,73 % con una latencia de 30,4 segundos. Las pruebas de rendimiento de hardware en una NVIDIA RTX PRO 5000 utilizando precisión BF16 y torch.compile() con un tamaño de lote de 32 demostraron velocidades de procesamiento que alcanzaron una aceleración del factor de tiempo real (RTFx) de 865× a 1,04 segundos de latencia y de 15.113× RTFx en la configuración fuera de línea de 30,4 segundos.
Integraciones en el ecosistema y consideraciones de despliegue
Dado que la diarización independiente genera marcas de tiempo de los hablantes en lugar de transcripciones de voz a texto, los sistemas posteriores deben emparejar el modelo con un motor de reconocimiento automático del habla (ASR) —como Parakeet-TDT 0.6B v3 o Nemotron ASR 3.5 de NVIDIA— para generar texto con atribución. Varios socios del ecosistema ya están integrando el modelo en flujos de trabajo especializados: Argmax incorporó Nemotron 3 Diarization en su Argmax Pro SDK 3 para ofrecer atribución en el dispositivo en tiempo real y una API de transcripción prediarizada, mientras que se destacaron flujos de despliegue en la nube para Baseten y DigitalOcean.
NVIDIA señala varios límites operativos para su implementación en producción real. Nemotron 3 Diarization restringe la atribución a un máximo de ocho hablantes; las conversaciones que superen ese límite presentarán pérdidas de fragmentos de voz o asignaciones incorrectas de canales. Además, retos acústicos como una reverberación extrema en la sala, grabaciones de campo lejano, ruido de fondo o variaciones significativas de dominio pueden provocar confusión entre hablantes, falsas alarmas e imprecisiones en los límites de las marcas de tiempo.



