Hugging Face lanza Open TTS Leaderboard para evaluar modelos de voz

Fuentes: Hugging Face launches Open TTS Leaderboard for scalable voice model evaluation

Hugging Face ha presentado el Open TTS Leaderboard, una herramienta diseñada para evaluar de forma escalable y objetiva los modelos de texto a voz (TTS) de código abierto y multilingüe. Esta iniciativa surge como respuesta a la fragmentación de las métricas de evaluación actuales, que dependen principalmente de preferencias humanas subjetivas y no pueden mantenerse al ritmo de la rápida publicación de nuevos modelos en la plataforma.

A diferencia de los leaderboards basados en arenas, que requieren votación humana y tiempo prolongado para recopilar datos, el nuevo sistema utiliza métricas objetivas calculadas en cuestión de horas. El sistema evalúa tres aspectos clave: la inteligibilidad mediante la tasa de error de palabras (WER) y caracteres (CER) utilizando el modelo Qwen3 ASR; la velocidad de inferencia midiendo el factor de tiempo real inverso (RTFx) y el tiempo hasta el primer audio (TTFA) en GPUs H200; y la similitud del hablante mediante la similitud coseno de las huellas dactilares de WavLM.

El leaderboard destaca por su enfoque multilingüe y su capacidad para evaluar la clonación de voz. Los modelos se clasifican según el rendimiento macro promedio en inglés y chino, con métricas específicas para idiomas basados en caracteres como el japonés y el coreano. Además, permite comparar modelos que soportan la clonación de voz, mostrando cómo el rendimiento mejora cuando se proporciona una referencia de audio. Esta herramienta busca complementar las preferencias humanas, ofreciendo a la comunidad un punto de referencia técnico para seleccionar modelos que equilibren calidad, velocidad y compatibilidad multilingüe.