La generación de video ha evolucionado rápidamente desde clips cortos de baja calidad hacia secuencias de alta resolución y duración larga con dinámicas espaciales y temporales complejas. Sin embargo, los modelos de video preentrenados suelen fallar en seguir la intención humana, mantener la coherencia temporal o cumplir con restricciones físicas y de seguridad. A diferencia de la generación de imágenes o texto, la alineación en video presenta desafíos únicos, como la acumulación de errores con el tiempo, el acoplamiento entre movimiento y apariencia, y la supervisión limitada de propiedades temporales. Estos problemas motivan estrategias de post-entrenamiento que adaptan modelos preentrenados sin reentrenarlos desde cero.
Este artículo presenta la primera revisión exhaustiva de post-entrenamiento y alineación en modelos de generación de video. El texto enmarca el post-entrenamiento como un marco unificador y distingue entre alineación implícita y explícita según cómo se imponen las señales de alineación. Desde esta perspectiva, se organizan los enfoques existentes en cuatro categorías amplias: métodos de ajuste fino supervisado, métodos de auto-entrenamiento y destilación, métodos basados en preferencias y recompensas, y métodos de inferencia en tiempo de ejecución. Esta taxonomía ofrece una visión coherente de cómo las señales de alineación moldean el comportamiento del modelo en tanto se entrena como se despliega.
Además de los avances metodológicos, la revisión analiza los conjuntos de datos y benchmarks comúnmente utilizados, así como las prácticas de evaluación. Se discuten desafíos abiertos, como el diseño de recompensas escalables, la consistencia temporal de largo alcance, el equilibrio entre estabilidad y expresividad, y la generación consciente de la seguridad. El objetivo de esta encuesta es proporcionar una base conceptual estructurada y una guía práctica para avanzar en el desarrollo de modelos de generación de video controlables y fiables.
