YODAS v3: dataset de audio multilingüe para reconocimiento y síntesis

Fuentes: YODAS v3: large-scale multilingual audio dataset for speech tasks

YODAS v3 es un conjunto de datos masivo de audio web-crawled que contiene más de 1,1 millones de horas de material sonoro, originalmente publicado bajo licencia CC-BY-3.0. Este recurso, alojado en Hugging Face, incluye audio en más de 100 idiomas y está diseñado para facilitar tareas multimodales como el Reconocimiento Automático del Habla (ASR), la Síntesis de Voz (TTS) y el Aprendizaje de Representaciones de Audio. A diferencia de las versiones anteriores (v1 y v2), YODAS v3 se construye a partir de un conjunto distinto de videos para garantizar la ausencia de solapamientos en los datos.

El dataset incluye metadatos detallados para cada archivo de audio, como transcripciones a nivel de segmento, traducciones al inglés (si están disponibles), identificadores de idioma, longitud, ancho de banda efectivo y número de canales. Aproximadamente el 75% de los datos cuenta con transcripciones, y el 60% de los datos no en inglés incluye traducciones al inglés. Todos los transcripciones y traducciones provienen con marcas de tiempo a nivel de frase, y el 95% de las transcripciones incluye marcas de tiempo a nivel de palabra. Los identificadores de idioma se obtienen mediante dos métodos: los proporcionados en la transcripción (considerados más precisos si están disponibles) y el idioma de origen del archivo. El directorio de carga se organiza por el identificador de idioma detectado, mientras que los archivos sin transcripción se almacenan en una carpeta específica. Este recurso es útil para investigadores y desarrolladores que requieren datos de audio de alta calidad y diversidad lingüística para entrenar modelos de lenguaje y procesamiento de audio.