Black Forest Labs FLUX 3: Vídeo + Áudio + Ação Multimídia em Um Modelo; Bate Seedance, Runway
Black Forest Labs desvendou FLUX 3 em 23 de julho de 2026, um modelo frontier multimídia treinado conjuntamente em imagens, vídeo, áudio e predição de ação dentro de uma arquitetura única. FLUX 3 Vídeo gera clipes de 20 segundos com áudio nativo sincronizado; FLUX 3 Ação prediz movimentos robóticos; FLUX 3 Imagem melhora geração de imagens estáticas. O modelo se baseia na abordagem Self-Flow da Black Forest Labs para alinhar compreensão e geração multimídia, escalada para bilhões de parâmetros em múltiplas modalidades simultaneamente.
Em avaliações iniciais de preferência humana, FLUX 3 Vídeo bate Runway Gen-4.5 em 77% de comparações e Luma Ray 3.2 em 93%, enquanto funciona em paridade com Seedance 2.0 e Gemini Omni (52% de vitórias). FLUX 3 é particularmente forte em expressões faciais humanas, renderização de texto multilingué, e associação de sons com eventos físicos. FLUX-mimic, um derivado de vídeo-ação, já está passando por testes e implantação na Audi para manipulação robótica de propósito geral, aprendendo novas tarefas a partir de apenas 30 minutos de dados robóticos.
O lançamento é em fases: FLUX 3 Vídeo e Ação estão em acesso antecipado agora; FLUX 3 Imagem sai nas próximas semanas; FLUX 3 Dev open-weight é promitido para mais tarde em 2026. Nenhum preço foi divulgado. Para construtores de sistemas criativos, robótica, e stacks de simulação, a unificação arquitetônica—um modelo para vídeo, imagem, áudio, e ação—sinaliza uma mudança de montar ferramentas específicas de modalidade para modelos de mundo unificados. FLUX.1 alcançou adoção aberta em difusão; a promessa de open-weight do FLUX 3 poderia acelerar adoção de robótica customizada e sistemas agentes.
Fontes
- Primary source
- globenewswire.com
“FLUX 3 jointly learns from images, video, and audio within a unified architecture, and can also be extended to predict actions”
- venturebeat.com
“FLUX 3 Video already leads in early evaluations against frontier video models, and is particularly strong in capturing human facial expressions, associating sounds with physical events, and multilingual capabilities”
- tech.yahoo.com
“human reviewers preferred FLUX 3's output over Runway Gen-4.5 in 77% of head-to-head comparisons and over Luma Ray 3.2 in 93%”