NVIDIA lanzó Nemotron 3 Diarization, un modelo de peso abierto con 100 millones de parámetros para identificación y atribución de locutores en tiempo real en audio multilocutor. El modelo ocupa el primer lugar en el leaderboard Diarization-Bench de Voice Arena con una tasa de error de diarización (DER) de 14.72% y admite hasta ocho locutores en conversaciones en vivo y grabadas, duplicando el límite de cuatro locutores de la línea base anterior Streaming Sortformer de NVIDIA.
El modelo acepta audio de canal único de 16 kHz, lo convierte en características de espectrograma de Mel con un paso de fotograma de 10 ms, y alimenta esas características a través de un codificador Transformer de 31 capas con incrustaciones posicionales rotatorias. La salida es un tensor de forma [T, 8]—T pasos de tiempo por ocho canales de locutor posibles—donde cada valor representa la probabilidad de que un locutor esté activo en ese momento. Durante la inferencia en streaming, dos mecanismos de memoria preservan la identidad del locutor entre fragmentos: un Arrival-Order Speaker Cache (AOSC) que retiene información sobre locutores observados anteriormente, organizados por canales ordenados por llegada, y una cola de primero en entrar, primero en salir (FIFO) que proporciona contexto de fotogramas recientes. Este diseño permite que un modelo funcione en múltiples puntos de latencia sin reentrenamiento.
El modelo admite cuatro latencias de búfer de entrada recomendadas: 30.4 segundos para procesamiento de estilo sin conexión, 1.04 segundos para baja latencia, 0.64 segundos para latencia muy baja, y 0.32 segundos para latencia ultra baja. Estos valores miden solo el audio almacenado en búfer antes de la inferencia; la computación, redes, ASR y procesamiento de aplicaciones se suman a la latencia de extremo a extremo. En la configuración de 30.4 segundos en una NVIDIA RTX PRO 5000 con tamaño de lote 32 y torch.compile(), el modelo alcanza 15,113× factor en tiempo real (RTFx)—lo que significa que procesa audio 15,113 veces más rápido que en tiempo real—en comparación con 2,619× para la línea base anterior, mientras reduce DER de DIHARD III de 19.09% a 12.73%. En la configuración de 1.04 segundos, logra 865× RTFx versus 136×, reduciendo DER de 19.60% a 13.18%.
Comparado con la línea base anterior Streaming Sortformer de cuatro locutores con latencia de 1.04 segundos, Nemotron 3 Diarization reduce DER en los ocho conjuntos de datos evaluados, con mejoras relativas que van desde 9.0% en CALLHOME-Part2 hasta 65.2% en NOTSOFAR1 MHM. La media no ponderada de reducciones relativas por conjunto de datos es 41.0%. La ventaja se amplía en condiciones de mayor número de locutores: en grabaciones de DIHARD III con cinco a nueve locutores, la mejora es mayor que en subconjuntos de dos locutores, aunque el máximo de ocho locutores del modelo significa que grabaciones con nueve locutores exceden su límite especificado.
El modelo genera etiquetas de locutor genéricas con marcas de tiempo, no verificación de identidad. Las aplicaciones posteriores deben asignar IDs de canal anónimos a identidades de locutor explícitas emparejando marcas de tiempo con metadatos de reunión, perfiles de usuario, o verificación de locutor activo. Los errores de diarización incluyen discurso perdido, falsas alarmas, asignaciones incorrectas de locutor y errores de límite. La publicación del blog de Hugging Face señala que el ruido, reverberación severa, grabación de campo lejano, cambio de dominio y conversaciones largas pueden aumentar estos errores. El modelo está diseñado para sistemas Linux con GPUs NVIDIA Ampere, Hopper o Blackwell compatibles y acepta audio mono de 16 kHz en formatos .wav, .flac, .opus y .mp3.
Para equipos que construyen sistemas de agentes basados en voz o canalizaciones de procesamiento de audio, el intercambio clave es entre latencia y precisión: búferes de entrada más cortos reducen el tiempo de respuesta pero degradan tanto la precisión como el rendimiento, por lo que la selección del punto de operación debe seguir los requisitos del producto de extremo a extremo en lugar de solo la duración del búfer.