El blog de tecnología de Netflix ha presentado dos investigaciones en fase inicial sobre edición de vídeo mediante inteligencia artificial generativa, orientadas a resolver dos limitaciones clave de los modelos actuales: las modificaciones no deseadas y la falta de coherencia física de la escena. La primera propuesta, Vera, es un modelo de difusión por capas que genera únicamente los elementos que deben cambiar como capas de edición separadas, manteniendo intactos el resto de píxeles del metraje original, lo que preserva identidades, interpretaciones y detalles de la escena. Para entrenarlo, el equipo construyó un conjunto de datos propio con 486.000 fotogramas a resolución 832×480. La segunda propuesta, VOID, es un modelo de inpainting diseñado para eliminar objetos y sus interacciones de forma físicamente plausible, reconstruyendo la escena como si el objeto nunca hubiera estado presente. Ambos trabajos se publican junto con sus respectivos artículos en arXiv para que la comunidad investigadora pueda replicarlos y avanzar en el campo. Los autores destacan que el objetivo es ofrecer a los artistas herramientas que les permitan decidir con precisión qué cambia y cómo cambia, manteniendo el control creativo.
