Análisis comparativo de modelos de audio con texto usando vocalizaciones de gatos

Fuentes: Comparative analysis of text-to-audio models using cat vocalizations

Un equipo de investigadores ha desarrollado una metodología para evaluar el rango expresivo de los modelos de generación de audio a partir de texto, utilizando vocalizaciones de gatos como caso de estudio. A diferencia de las evaluaciones tradicionales basadas en métricas acústicas estándar, este enfoque emplea diagramas de rango expresivo para visualizar la distribución de las salidas en dimensiones de timbre, tono y volumen. El análisis se basa en 2.100 clips generados con tres modelos distintos (Stable Audio Open, TangoFlux y EzAudio) y siete prompts, permitiendo comparar cómo cada arquitectura responde a la especificidad del texto.

Los resultados revelan diferencias significativas entre los modelos. Stable Audio Open y TangoFlux generan vocalizaciones coherentes y variadas, aunque el rango de timbre se estrecha cuando se especifica la acción de maullar. En contraste, EzAudio muestra una alta tasa de silencio o ruido de fondo, atribuido a su entrenamiento con transcripciones de videos no curados donde los gatos suelen estar en silencio. El estudio demuestra que los modificadores descriptivos, como 'maullido lamento' o 'gato enojado', no producen desplazamientos acústicos consistentes ni paralelos entre los modelos, lo que indica que la interpretación semántica varía de forma no lineal. Esta herramienta técnica permite a los desarrolladores auditar la calidad y la fidelidad de los generadores de audio, ofreciendo una perspectiva más intuitiva que las métricas numéricas tradicionales como la distancia de Fréchet o el score CLAP.