FLUX 3 x mimic: un modelo de vídeo-acción para controlar robots en líneas de producción de Audi

Fuentes: FLUX 3 x mimic: The Next Generation of Video-Action Models

Black Forest Labs y mimic robotics presentaron FLUX-mimic, un modelo de vídeo-acción construido sobre FLUX 3, la nueva base multimodal de BFL. A diferencia de FLUX 1 y FLUX 2, centrados en generación de imágenes, FLUX 3 se entrena de forma conjunta con imágenes, vídeo y audio y dedica más del 95 % del cómputo a la predicción de vídeo, lo que obliga al modelo a aprender contacto, movimiento, peso y causalidad física.

Los autores sostienen que esa representación interna del mundo, una vez aprendida, permite decodificar acciones robóticas sin necesidad de entrenar un modelo aparte. En pruebas internas, añadir predicción de acciones al entrenamiento redujo hasta un 10 % la calidad de generación de vídeo, pero tras 3 500 pasos el modelo recuperó su rendimiento previo y, además, predecía acciones. La técnica se apoya en Self-Flow, un marco que unifica aprendizaje generativo y de representación.

FLUX-mimic se entrena como un decodificador ligero sobre las características intermedias del predictor de vídeo de FLUX 3. La colaboración con mimic robotics aporta el conocimiento en aprendizaje robótico, manipulación diestra y despliegue industrial, y los primeros robots con el modelo operan ya en líneas de producción de Audi. BFL enmarca laPhysical AI como una extensión natural de su hoja de ruta, no como un giro estratégico.