Black Forest Labs FLUX 3: modelo multimodal unificado gera vídeo, áudio e ações robô de arquitetura única
Black Forest Labs revelou FLUX 3 em 23 de julho, um modelo de fronteira multimodal treinado conjuntamente em imagens, vídeo, áudio e predição de ação dentro de uma arquitetura unificada única construída na abordagem Self-Flow da empresa. FLUX 3 Video gera clips de até 20 segundos com áudio nativo e sincronizado a partir de prompts de texto, imagens ou referências de vídeo; suporta continuação de vídeo, transições keyframe, diálogo multilíngue e encadeamento de múltiplos clips. Em avaliações internas iniciais, BFL alega que FLUX 3 Video supera Runway Gen-4.5 em 77% de comparações frente a frente e Luma Ray 3.2 em 93%, embora sejam benchmarks preliminares e auto-relatórios com metodologia completa para seguir em disponibilidade mais ampla.
O insight chave da arquitetura é que geração de vídeo e predição de ação não requerem fundamentos separados—as mesmas representações aprendidas de estrutura espacial, dinâmica temporal e causalidade servem ambas. Ao lado de FLUX 3 Video, BFL e parceiro de robótica mimic anunciaram FLUX-mimic, um modelo video-ação em implantação inicial com Audi. FLUX-mimic pode afinar tarefas de manipulação robótica novas a partir de tão pouco quanto 30 minutos de dados de robô, comparado a horas com abordagens anteriores. BFL está preparando o rollout: FLUX 3 Image (sucessor de imagem estática para FLUX.2) envia em semanas que vem, FLUX 3 Action para parceiros comerciais em paralelo, e FLUX 3 Dev de peso aberto planejado para mais tarde em 2026.
Para profissionais, isto unifica uma aposta arquitetural de longo prazo: que geração de conteúdo e IA física compartilham representação subjacente suficiente que um modelo pode servir ambas. A história de treinamento multimodal—aprender imagens ensinam estrutura, vídeo ensina movimento, áudio ensina causalidade, cada uma restringindo as outras—ecoa trabalho recente em modelos do mundo. Entretanto, riscos de execução permanecem: números de vídeo de BFL são preliminares, FLUX 3 Image ainda não está disponível para avaliação, e pesos abertos são promessa posterior de 2026. Se BFL entregar pesos abertos no cronograma, FLUX 3 Dev será o primeiro modelo multimodal aberto abrangendo vídeo, imagem, áudio e ação em uma arquitetura, reformulando a pilha para construtores escolhendo entre ferramentas especialistas e plataformas unificadas.
Fontes
- Primary source
- bfl.ai
“FLUX 3 is trained across those signals together, so the model can build a deeper understanding of how the world works. Images capture spatial structures, videos restore temporal dynamics, and audio reveals causal relationships.”
- venturebeat.com
“FLUX 3 Video already leads in early evaluations against frontier video models, with human reviewers preferring FLUX 3's output over Runway Gen-4.5 in 77% of comparisons and over Luma Ray 3.2 in 93%.”
- manilatimes.net
“FLUX-mimic is designed for general-purpose robotic manipulation: helping robots understand a visual scene, predict the consequences of an action, and adapt to new tasks with far less task-specific data, with fine-tuning possible from as little as 30 minutes of robot data.”