En bref

  • Black Forest Labs a lancé FLUX 3 en accès anticipé, son premier modèle qui génère de la vidéo, produisant des clips jusqu'à 20 secondes avec audio synchronisé.
  • La même architecture alimente FLUX-mimic, un modèle robotique développé avec mimic robotics qu'Audi teste déjà sur sa chaîne de production.
  • Seule la version "Dev" à poids ouverts est prévue pour plus tard en 2026 ; Video et Action restent derrière des API et un accès partenaire pour l'instant, avec Image qui suivra dans les semaines à venir.

Black Forest Labs a publié FLUX 3 jeudi, et pour la première fois, le modèle phare de l'entreprise génère de la vidéo au lieu de simples images fixes. Le laboratoire d'IA allemand, connu pour la gamme FLUX de générateurs d'images, a entraîné le nouveau système sur des images, des vidéos et de l'audio simultanément, dans un système partagé unique.

C'est ce qu'on appelle la multimodalité : un seul modèle apprend plusieurs types d'informations ensemble au lieu d'outils séparés juxtaposés.

Le côté vidéo est la fonctionnalité phare. FLUX 3 produit des clips jusqu'à 20 secondes, avec un audio généré en même temps que l'image et synchronisé avec ce qui se passe à l'écran—dialogues, effets sonores, bruit ambiant. Dans les premières évaluations, les évaluateurs humains ont préféré la sortie de FLUX 3 à celle de Runway Gen-4.5 dans 77% des comparaisons en tête-à-tête et à Luma Ray 3.2 dans 93%. Il semble être légèrement meilleur que Gemini Omni et Seedance, battant ces modèles dans 52% des évaluations.

Bien sûr, c'est un test de préférence, pas une grille de notation fixe : les évaluateurs regardent simplement deux clips et choisissent celui qui semble le plus convaincant visuellement et auditivement, et BFL compte combien de fois FLUX 3 gagne.

À part cela, le modèle semble également très compétent sur les images fixes, poursuivant son héritage. BFL a partagé quelques images, et FLUX 3 semble très polyvalent et capable de générer une grande variété de styles au-delà du photoréalisme.

BFL présente cela comme plus qu'un outil de contenu. « Un modèle qui n'apprend que des images ne peut générer que des images », a déclaré le cofondateur et PDG Robin Rombach. Le pari de l'entreprise est qu'apprendre à prédire des vidéos signifie aussi apprendre la physique qui les sous-tend — le poids, le contact, le timing — ce qui est exactement ce dont une machine a besoin pour se déplacer dans le monde physique.

Ce pari a un nom : FLUX-mimic. Construit avec la robotique mimic basée à Zurich, il prend le moteur de prédiction vidéo de FLUX 3 et ajoute un « décodeur » léger — un petit composant supplémentaire qui traduit la compréhension interne du modèle de la façon dont les choses bougent en mouvements robotiques réels. Le constructeur automobile Audi le teste déjà sur des tâches comme l'ajustement de joints de porte flexibles, un travail que l'automatisation conventionnelle a eu du mal à gérer.

« Audi représente le type de partenaire de fabrication pour lequel nous avons conçu FLUX-mimic », a déclaré Stephan-Daniel Gravert, cofondateur de mimic. Christoph Schneider, d'Audi, a déclaré que les robots résolvent désormais « des tâches complexes de manipulation de corps souples » que les anciennes machines ne pouvaient pas aborder. BFL affirme que le système complet réagit en environ 101 millisecondes, soit à proximité des réflexes visuels humains.

L'ascension de FLUX ne s'est pas produite dans le vide. Fondé en août 2024 par des chercheurs chevronnés qui avaient contribué à la création des modèles originaux Stable Diffusion chez Stability AI, Black Forest Labs a lancé des modèles Flux qui ont surpassé MidJourney et surclassé le décevant Stable Diffusion 3 de Stability.

Les modèles open source Flux Dev et Schnell ont décroché le titre de « meilleur générateur d'images open source » que les artistes IA attendaient de Stable Diffusion 3.5, le remake de Stability, pour éventuellement reconquérir.

Il ne l'a jamais fait. FLUX 1.1 Pro a ensuite dominé l'arène d'images Artificial Analysis en octobre. Celui-là n'était cependant pas open source.

BFL a publié FLUX.2 en novembre 2025 mais il n'a pas été aussi populaire. La couronne open source détenue par le Flux original a duré jusqu'à ce que le Z-Image Turbo d'Alibaba le détrône fin 2025, égalant sa qualité sur des cartes graphiques grand public de gamme inférieure. « C'est ce que SD3 était censé être », a écrit un utilisateur de CivitAI à l'époque.

FLUX 3 est le retour de BFL, et il n'est pas encore entièrement ouvert. La vidéo et l'action sont en accès anticipé via les API et des partenaires sélectionnés, dont mimic robotics, avec la génération d'images qui suivra "dans les semaines à venir", selon BFL. La version Dev à poids ouverts, le seul niveau que BFL prévoit de publier pour une utilisation locale, n'est pas attendue avant plus tard en 2026.