Black Forest Labs (BFL) ha anunciado FLUX 3, su nuevo modelo fundacional multimodal entrenado de forma conjunta con imágenes, vídeo y audio dentro de una arquitectura unificada. La compañía defiende que ninguna modalidad por sí sola describe la realidad: el sonido debe corresponderse con el impacto, el movimiento con la masa y el futuro con el pasado, y solo al aprender de todas a la vez esas restricciones mutuas revelan información sobre el mundo subyacente. FLUX 3 se apoya en la técnica Self-Flow, desarrollada internamente por BFL, que permite alinear la generación y la comprensión multimodales en una sola arquitectura y que la empresa ha escalado en cómputo y datos.
El componente de vídeo, ya disponible en acceso anticipado, genera clips de hasta 20 segundos con audio nativo a partir de texto, imágenes o vídeo de referencia. Soporta continuación desde un fotograma inicial, transferencia de elementos entre escenas, continuidad de vídeo y audio, keyframes, diálogo multilingüe, una amplia variedad de estilos y relaciones de aspecto, y el encadenamiento de varios clips en secuencias. En evaluaciones preliminares de preferencia, BFL indica que FLUX 3 Video fue preferido sobre Grok Imagine Video hasta en un 69% de las comparaciones, sobre Kling v3 Pro en un 60%, sobre Runway Gen-4.5 en un 77% y sobre Luma Ray 3.2 en un 93%.
En imagen, FLUX 3 mejora la gestión de instrucciones complejas y la renderización tipográfica en varios idiomas, con un acceso anticipado previsto en las próximas semanas. El modelo también incorpora predicción de acciones y, en colaboración con mimic robotics, se ha desarrollado FLUX-mimic, un modelo de vídeo-acción orientado a manipulación diestra y despliegue en producción, ya probado en tareas reales en Audi. BFL planea lanzar por fases capacidades de vídeo, imagen y predicción de acciones, además de una versión de pesos abiertos llamada FLUX 3 Dev, y detalla que ya trabaja en la próxima generación con el objetivo de unificar percepción, acción y lenguaje en un único modelo.
