LAION-BVD: un corpus abierto de 10 millones de horas de vídeo para entrenar modelos multimodales

Fuentes: LAION-BVD: a 10-million-hour open video dataset for multimodal pre-training

El proyecto LAION ha presentado LAION-BVD, un conjunto de datos de vídeo a gran escala y código abierto destinado al entrenamiento de modelos multimodales. A partir de 1.300 millones de URLs recogidas de Common Crawl, el equipo descargó 80 millones de vídeos con una duración total de 10 millones de horas, a los que se aplicó detección de escenas para extraer clips con subtítulos sintéticos de vídeo y audio.

El dataset permite entrenar modelos para tareas de vídeo-texto, audio-texto e imagen-texto. Los modelos ViCLIP entrenados con LAION-BVD igualan o superan a los entrenados con InternVid hasta en 2,1 puntos en pruebas estándar de vídeo-texto, con mejoras al aumentar la escala de 10 a 50 millones de clips. Los modelos CLAP obtienen resultados competitivos en audio frente a otros corpus no curados, y los marcos extraídos de los vídeos, al presentar una distribución visual distinta de los corpus web clásicos, permiten entrenar modelos CLIP con buen desempeño en recuperación imagen-texto.

LAION-BVD se publica exclusivamente con fines de investigación, no comerciales, y sus autores subrayan que busca democratizar el acceso a datos de entrenamiento multimodales, hoy concentrados en grandes tecnológicas propietarias. El conjunto puede contener sesgos y estereotipos derivados de la web, por lo que se recomienda a los equipos que los evalúen y reporten junto con las capacidades de sus modelos. Está disponible para la comunidad científica en arXiv (2608.24845).