Black Forest Labs FLUX 3: Vídeo + Audio + Acción Multimodal en Un Modelo; Supera Seedance, Runway
Black Forest Labs reveló FLUX 3 el 23 de julio de 2026, un modelo frontier multimodal entrenado conjuntamente en imágenes, video, audio y predicción de acciones dentro de una arquitectura única. FLUX 3 Video genera clips de 20 segundos con audio nativo sincronizado; FLUX 3 Action predice movimientos robóticos; FLUX 3 Image mejora generación de imágenes fijas. El modelo se basa en el enfoque Self-Flow de Black Forest Labs para alinear comprensión y generación multimodal, escalado a miles de millones de parámetros en múltiples modalidades simultáneamente.
En evaluaciones iniciales de preferencia humana, FLUX 3 Video supera Runway Gen-4.5 en 77% de comparaciones y Luma Ray 3.2 en 93%, mientras funciona a paridad con Seedance 2.0 y Gemini Omni (52% de victorias). FLUX 3 es particularmente fuerte en expresiones faciales humanas, renderización de texto multilingüe, y asociación de sonidos con eventos físicos. FLUX-mimic, un derivado de video-acción, ya está siendo probado e implementado en Audi para manipulación robótica de propósito general, aprendiendo nuevas tareas de tan solo 30 minutos de datos robóticos.
El lanzamiento es por fases: FLUX 3 Video y Action están en acceso temprano ahora; FLUX 3 Image se lanza en las próximas semanas; FLUX 3 Dev open-weight es prometido para más tarde en 2026. Sin precios divulgados. Para constructores de sistemas creativos, robótica, y stacks de simulación, la unificación arquitectónica—un modelo para video, imagen, audio, y acción—señala un cambio de ensamblar herramientas específicas de modalidad hacia modelos de mundo unificados. FLUX.1 logró adopción abierta en difusión; la promesa open-weight de FLUX 3 podría acelerar adopción de robótica personalizada y sistemas agentes.
Fuentes
- Primary source
- globenewswire.com
“FLUX 3 jointly learns from images, video, and audio within a unified architecture, and can also be extended to predict actions”
- venturebeat.com
“FLUX 3 Video already leads in early evaluations against frontier video models, and is particularly strong in capturing human facial expressions, associating sounds with physical events, and multilingual capabilities”
- tech.yahoo.com
“human reviewers preferred FLUX 3's output over Runway Gen-4.5 in 77% of head-to-head comparisons and over Luma Ray 3.2 in 93%”