Em resumo
- A Black Forest Labs lançou o FLUX 3 em acesso antecipado, seu primeiro modelo que gera vídeo, produzindo clipes de até 20 segundos com áudio sincronizado.
- A mesma espinha dorsal alimenta o FLUX-mimic, um modelo de robótica construído com a mimic robotics que a Audi já está testando em sua linha de produção.
- Apenas a versão de pesos abertos "Dev" está planejada para o final de 2026; Vídeo e Ação permanecem atrás de APIs e acesso de parceiros por enquanto, com Imagem seguindo nas próximas semanas.
A Black Forest Labs lançou o FLUX 3 na quinta-feira e, pela primeira vez, o modelo principal da empresa gera vídeo em vez de apenas imagens estáticas. O laboratório alemão de IA, conhecido pela linha FLUX de geradores de imagem, treinou o novo sistema em imagens, vídeo e áudio ao mesmo tempo, dentro de um sistema compartilhado.
Isso é o que se chama de multimodalidade: um modelo aprendendo vários tipos de informação juntos, em vez de ferramentas separadas conectadas lado a lado.
O lado do vídeo é o recurso principal. O FLUX 3 produz clipes de até 20 segundos, com áudio gerado junto com a imagem e sincronizado com o que está acontecendo na tela—diálogo, efeitos sonoros, ruído ambiente. Em avaliações iniciais, revisores humanos preferiram a saída do FLUX 3 em relação ao Runway Gen-4.5 em 77% das comparações diretas e em relação ao Luma Ray 3.2 em 93%. Parece ser ligeiramente melhor que o Gemini Omni e o Seedance, superando esses modelos em 52% das avaliações.

Claro, isso é um teste de preferência, não uma rubrica de pontuação fixa: os avaliadores simplesmente assistem a dois clipes e escolhem o que parece e soa mais convincente, e a BFL conta quantas vezes o FLUX 3 vence.
Fora isso, o modelo parece ser muito competente também em imagens estáticas, seguindo seu legado. A BFL compartilhou algumas imagens, e o FLUX 3 parece ser muito versátil e capaz de gerar uma ampla variedade de estilos além do fotorrealismo.
A BFL enquadra isso como mais do que uma ferramenta de conteúdo. “Um modelo que só aprende imagens só pode gerar imagens”, disse o cofundador e CEO Robin Rombach. A aposta da empresa é que aprender a prever vídeo também significa aprender a física subjacente—peso, contato, tempo—que é exatamente o que uma máquina precisa para se mover pelo mundo físico.
Essa aposta tem um nome: FLUX-mimic. Construído com a mimic robotics, sediada em Zurique, ele pega o mecanismo de previsão de vídeo do FLUX 3 e adiciona um “decodificador” leve—um pequeno componente adicional que traduz o senso interno do modelo de como as coisas se movem em movimentos reais de robô. A montadora Audi já está testando-o em tarefas como encaixar selos de porta flexíveis, um trabalho que a automação convencional tem dificuldade em lidar.

“A Audi representa o tipo de parceiro de manufatura para o qual construímos o FLUX-mimic”, disse o cofundador da mimic, Stephan-Daniel Gravert. Christoph Schneider, da Audi, disse que os robôs agora “resolvem trabalhos complexos de manipulação de corpos moles” que máquinas mais antigas não conseguiam tocar. A BFL afirma que o sistema completo reage em cerca de 101 milissegundos, próximo dos reflexos visuais humanos.
A ascensão do FLUX não aconteceu no vácuo. Fundada em agosto de 2024 por pesquisadores veteranos que ajudaram a construir os modelos originais de Stable Diffusion na Stability AI, a Black Forest Labs lançou modelos Flux que superaram o MidJourney e superaram o decepcionante Stable Diffusion 3 da própria Stability.
Os modelos de código aberto Flux Dev e Schnell conquistaram o título de “melhor gerador de imagens de código aberto” que os artistas de IA esperavam que o Stable Diffusion 3.5, a segunda tentativa da Stability, eventualmente recuperasse.
Isso nunca aconteceu. O FLUX 1.1 Pro chegou ao topo da arena de imagens Artificial Analysis em outubro. Mas esse não era de código aberto.
A BFL lançou o FLUX.2 em novembro de 2025, mas não foi tão popular. A coroa de código aberto mantida pelo Flux original durou até o Z-Image Turbo da Alibaba destroná-lo no final de 2025, igualando sua qualidade em placas gráficas de consumo de baixo custo. “Isso é o que o SD3 deveria ser”, escreveu um usuário do CivitAI na época.
FLUX 3 é o retorno da BFL, e ainda não está totalmente aberto. Vídeo e Ação estão em acesso antecipado agora através de APIs e parceiros selecionados, incluindo a mimic robotics, com a geração de imagens seguindo "nas próximas semanas", de acordo com a BFL. A versão Dev de pesos abertos, o único nível que a BFL planeja lançar para uso local, não está prevista até mais tarde em 2026.






