NVIDIA ha publicado Nemotron-3-Diarización, un modelo de diarización de hablantes de código abierto diseñado para determinar quién habló y cuándo en audio real. Este modelo, basado en la arquitectura Sortformer, soporta la inferencia en tiempo real y en lote, gestionando hasta ocho hablantes simultáneamente. Su objetivo principal es resolver la permutación de hablantes ordenando las salidas según el orden de llegada en la señal de entrada, una técnica que mejora la precisión en entornos con múltiples voces.
El sistema ofrece flexibilidad técnica significativa. Para aplicaciones críticas de latencia, permite una latencia de entrada tan baja como 80 milisegundos, aunque la configuración recomendada para streaming es de 0,32 segundos. La configuración de estilo en línea utiliza una ventana de entrada de 30,4 segundos. La resolución de salida es configurable en múltiplos de 10 milisegundos, y la inferencia por bloques elimina límites de duración en el audio de entrada. El modelo está listo para uso comercial o no comercial y se integra con frameworks como NeMo y Transformers, además de contar con demos en Google Colab y Kaggle. Esta herramienta es relevante para aplicaciones de transcripción automática de voz (ASR) que requieren etiquetado de hablantes a nivel de palabra, facilitando la integración en sistemas de reuniones, asistentes virtuales y análisis de audio.
