Linum publica unas notas técnicas que detallan cómo ha evolucionado su estrategia de filtrado de datos para entrenar modelos generativos de vídeo. Aunque las redes neuronales apenas han cambiado desde Stable Diffusion 3, la mayoría de las mejoras recientes se atribuyen a tres ejes: filtrado y rebalanceo del conjunto de datos, anotaciones más ricas y generación de datos sintéticos con modelos existentes.
El artículo repasa las lecciones aprendidas desde 2024, cuando el equipo construyó su primera canalización de filtrado utilizando solo CPUs y algoritmos clásicos de visión por computador. Entre las técnicas descritas figuran la detección de cambios de plano con PySceneDetect, el uso del detector EAST (de 2017) para descartar vídeos con exceso de texto en pantalla, y la explotación de los vectores de movimiento H.264 almacenados en los archivos mp4 para descartar escenas estáticas o excesivamente caóticas con un sencillo árbol de decisión basado en la norma L2.
Los autores subrayan que la revisión manual de muestras y la construcción de una ontonomía de categorías «buenas» y «malas» son pasos críticos para rebalancear el conjunto de datos y evitar que las clases sobrerrepresentadas dominen el entrenamiento. También explican por qué conviene eliminar los clips cuya cualidad principal resulta indescriptible en lenguaje natural —primeros planos sin acción o partidos de fútbol con movimiento caótico— porque el texto sigue siendo el principal mecanismo de condicionamiento de los modelos actuales de texto a vídeo.
