Black Forest Labs lança FLUX 3, modelo multimodal unificado para imagem, vídeo, áudio e ação de robô
Black Forest Labs lançou FLUX 3 em 23 de julho, um modelo multimodal unificado treinado em uma arquitetura única abrangendo imagem, vídeo, áudio e previsão de ação. O modelo suporta geração de texto-para-vídeo e imagem-para-vídeo, transformação vídeo-para-vídeo a partir de clipes de referência, continuação de áudio generativo, transições quadro-chave-para-vídeo, diálogo multilíngue e encadeamento agentic de clipes em sequências mais longas. FLUX 3 Video está agora disponível em acesso antecipado, com uma versão de peso de desenvolvedor a caminho. A arquitetura unificada contrasta com geradores anteriores específicos de modalidade, consolidando capacidades de imagem e vídeo que anteriormente exigiam modelos separados.
O lançamento inclui FLUX-mimic, desenvolvido em conjunto com Mimic Robotics, que emparelha o backbone FLUX 3 com expertise em aprendizado de robô para ativar previsão de ação e controle em sistemas físicos. FLUX-mimic pode ser implantado em robôs reais, demonstrando que FLUX 3 está aprendendo um modelo de mundo suficiente capaz de dirigir manipulação destra e tarefas reais de fábrica. O time também reivindicava forte desempenho em estilos visuais (filmagem candid para animação), geração de tipografia e design, e proporções de aspecto diversas estendendo-se além de formatos cinematográficos convencionais.
A afirmação de FLUX 3 de treinamento unificado entre modalidades e implantação direta de robô é notável porque demonstra capacidade generativa estendendo-se além de mídia tradicional para controle incorporado. A construção do desenvolvedor aberto representa um movimento competitivo contra Sora, Grok Imagine e Gemini Omni—a comunidade agora está verificando reprodução independente de capacidades multimodais de fronteira fora dos maiores laboratórios. Arquitetos avaliando pilhas de vídeo-plus-controle para robótica ou pipelines de vídeo agentic devem avaliar FLUX 3 ao lado de APIs pagas.