Коротко

  • Black Forest Labs запустила FLUX 3 у ранньому доступі — це її перша модель, що генерує відео, створюючи кліпи тривалістю до 20 секунд із синхронізованим звуком.
  • Та сама базова архітектура живить FLUX-mimic, робототехнічну модель, створену спільно з mimic robotics, яку Audi вже тестує на своїй виробничій лінії.
  • Лише версія з відкритою вагою «Dev» запланована на пізніший період 2026 року; Video та Action залишаються за API та партнерським доступом, а Image з'явиться протягом наступних тижнів.

Black Forest Labs випустила FLUX 3 у четвер, і вперше флагманська модель компанії генерує відео, а не лише нерухомі зображення. Німецька AI-лабораторія, відома лінійкою генераторів зображень FLUX, навчала нову систему на зображеннях, відео та аудіо одночасно, в одній спільній системі.

Це те, що називають мультимодальністю: одна модель вивчає кілька типів інформації разом, а не окремі інструменти, з'єднані поруч.

Відео-частина є головною функцією. FLUX 3 створює кліпи тривалістю до 20 секунд, з аудіо, згенерованим разом із зображенням і синхронізованим із тим, що відбувається на екрані — діалоги, звукові ефекти, фонові шуми. У ранніх оцінках людські рецензенти віддавали перевагу результатам FLUX 3 над Runway Gen-4.5 у 77% порівнянь віч-на-віч і над Luma Ray 3.2 у 93%. Здається, він трохи кращий за Gemini Omni та Seedance, перевершуючи ці моделі у 52% оцінок.

Звичайно, це тест на перевагу, а не фіксована рубрика оцінювання: оцінювачі просто переглядають два кліпи і обирають той, який виглядає та звучить переконливіше, і BFL підраховує, як часто FLUX 3 перемагає.

Крім того, модель, схоже, дуже добре справляється і з нерухомими зображеннями, продовжуючи свою спадщину. BFL поділилися кількома зображеннями, і FLUX 3, здається, дуже універсальний і здатний генерувати широкий спектр стилів, окрім фотореалізму.

BFL позиціонує це як більше, ніж інструмент для створення контенту. «Модель, яка навчається лише на зображеннях, може лише генерувати зображення», — сказав співзасновник і генеральний директор Робін Ромбах. Ставка компанії полягає в тому, що навчання передбаченню відео також означає вивчення фізики, що лежить в його основі — ваги, контакту, часу — саме те, що потрібно машині, щоб рухатися у фізичному світі.

Ця ставка має назву: FLUX-mimic. Створений спільно з цюрихською компанією mimic robotics, він бере рушій передбачення відео FLUX 3 і додає легкий «декодер» — невеликий додатковий компонент, який перетворює внутрішнє відчуття моделі того, як рухаються речі, у фактичні рухи робота. Автовиробник Audi вже тестує його на таких завданнях, як встановлення гнучких ущільнювачів дверей, робота, з якою традиційна автоматизація насилу справлялася.

«Audi представляє саме такого виробничого партнера, для якого ми створили FLUX-mimic», — сказав співзасновник mimic Штефан-Даніель Граверт. Крістоф Шнайдер з Audi зазначив, що роботи тепер «вирішують складні завдання з маніпуляцією м'якими тілами», які старі машини не могли виконати. BFL стверджує, що повна система реагує приблизно за 101 мілісекунду, що близько до рефлексів людського зору.

Зростання FLUX не відбулося у вакуумі. Заснована в серпні 2024 року досвідченими дослідниками, які допомогли створити оригінальні моделі Stable Diffusion у Stability AI, Black Forest Labs випустила моделі Flux, які перевершили MidJourney та перевершили власну невдалу Stable Diffusion 3.

Відкриті моделі Flux Dev та Schnell отримали титул «найкращий генератор зображень з відкритим кодом», який, як очікували AI-художники, зрештою мала повернути собі Stable Diffusion 3.5, перероблена версія Stability.

Цього так і не сталося. FLUX 1.1 Pro у жовтні очолив Artificial Analysis image arena. Однак ця версія не була з відкритим кодом.

BFL випустила FLUX.2 у листопаді 2025 року, але він не був таким популярним. Корона відкритого коду, яку тримав оригінальний Flux, трималася до тих пір, поки Z-Image Turbo від Alibaba не скинув його наприкінці 2025 року, зрівнявшись з його якістю на дешевших споживчих відеокартах. «Це те, чим мав бути SD3», — написав тоді один користувач CivitAI.

FLUX 3 — це повернення BFL, і воно ще не повністю відкрите. Відео та Action зараз доступні в ранньому доступі через API та окремих партнерів, серед яких mimic robotics, а генерація зображень — «в найближчі тижні», за словами BFL. Версія Dev з відкритою вагою, єдиний рівень, який BFL планує випустити для локального використання, вийде не раніше кінця 2026 року.