Black Forest Labs FLUX 3: modelo multimodal unificado genera vídeo, audio y acciones de robot desde arquitectura única
Black Forest Labs reveló FLUX 3 el 23 de julio, un modelo de frontera multimodal entrenado conjuntamente en imágenes, vídeo, audio y predicción de acciones dentro de una única arquitectura unificada construida en el enfoque Self-Flow de la empresa. FLUX 3 Video genera clips de hasta 20 segundos con audio nativo y sincronizado a partir de indicaciones de texto, imágenes o referencias de vídeo; soporta continuación de vídeo, transiciones de fotogramas clave, diálogos multilingües y encadenamiento de múltiples clips. En evaluaciones internas iniciales, BFL afirma que FLUX 3 Video supera Runway Gen-4.5 en 77% de comparaciones frente a frente y Luma Ray 3.2 en 93%, aunque son puntos de referencia preliminares y auto-reportados con metodología completa a seguir en disponibilidad más amplia.
La idea clave de la arquitectura es que la generación de vídeo y la predicción de acciones no requieren fundamentos separados—las mismas representaciones aprendidas de estructura espacial, dinámica temporal y causalidad sirven a ambas. Junto a FLUX 3 Video, BFL y el socio de robótica mimic anunciaron FLUX-mimic, un modelo video-acción en implementación temprana con Audi. FLUX-mimic puede ajustar nuevas tareas de manipulación robótica a partir de tan solo 30 minutos de datos de robot, en comparación con horas con enfoques anteriores. BFL está preparando el despliegue: FLUX 3 Image (sucesor de imagen estática de FLUX.2) se envía en las próximas semanas, FLUX 3 Action para socios comerciales en paralelo, y FLUX 3 Dev de pesos abiertos planeado para más tarde en 2026.
Para profesionales, esto unifica una apuesta arquitectónica de larga data: que la generación de contenido e IA física comparten representación subyacente suficiente para que un modelo pueda servir a ambas. La historia de entrenamiento multimodal—aprender que las imágenes enseñan estructura, el vídeo enseña movimiento, el audio enseña causalidad, cada uno restringiendo los otros—hace eco del trabajo reciente en modelos del mundo. Sin embargo, los riesgos de ejecución permanecen: los números de vídeo de BFL son preliminares, FLUX 3 Image aún no está disponible para evaluación, y los pesos abiertos son una promesa posterior de 2026. Si BFL entrega pesos abiertos según el cronograma, FLUX 3 Dev será el primer modelo multimodal abierto que abarca vídeo, imagen, audio y acción en una arquitectura, reformulando la pila para constructores que eligen entre herramientas especializadas y plataformas unificadas.
Fuentes
- Primary source
- bfl.ai
“FLUX 3 is trained across those signals together, so the model can build a deeper understanding of how the world works. Images capture spatial structures, videos restore temporal dynamics, and audio reveals causal relationships.”
- venturebeat.com
“FLUX 3 Video already leads in early evaluations against frontier video models, with human reviewers preferring FLUX 3's output over Runway Gen-4.5 in 77% of comparisons and over Luma Ray 3.2 in 93%.”
- manilatimes.net
“FLUX-mimic is designed for general-purpose robotic manipulation: helping robots understand a visual scene, predict the consequences of an action, and adapt to new tasks with far less task-specific data, with fine-tuning possible from as little as 30 minutes of robot data.”