Коротко
- Qwen-Image-3.0, випущена 21 липня командою Qwen від Alibaba, приймає 4500 токенів інструкцій.
- Це дозволяє однопрохідну генерацію складних макетів, таких як газети, розкадрування та щільні сітки інфографіки.
- На відміну від свого попередника, цей випуск вийшов без відкритих ваг моделі, бенчмарків або технічного звіту; він доступний на chat.qwen.ai, ціни на API ще не розкриті.
Команда Qwen від Alibaba запустила Qwen Image 3.0 у вівторок, і їхня пропозиція не має нічого спільного з тим, наскільки красивим є результат. Йдеться про те, чи можна фактично використовувати результат у роботі.
Більшість інструментів для генерації зображень на основі ШІ—Reve, Nano Banana, Seedream—розроблені, щоб досягати успіху в конкретних сферах: креативність, реалістичність, можливості редагування тощо. Qwen Image 3.0 йде в іншому напрямку. «Qwen-Image-3.0 не просто прагне до "красивого"—вона прагне до "корисного", роблячи генерацію зображень справді розгорнутим інструментом продуктивності»,—написали в команді Qwen в офіційному оголошенні.
Центральним елементом є те, що китайський гігант Alibaba називає багатим контентом. Модель приймає до 4500 токенів, що в 4,5 раза більше, ніж міг обробити попередній покоління. Токени—це одиниці тексту, які читає ШІ; уявіть токен як приблизно одне слово або частину слова, тож 4500 токенів—це кілька сторінок детальних інструкцій
Цього достатньо, щоб описати дев'ять окремих панелей інфографіки в одному запиті та отримати їх як одне ціле зображення.

"Все зображення вище було згенеровано Qwen-Image-3.0 за один прохід, а не зібрано з кількох зображень," написала Alibaba у своєму блозі. Кожна панель у демонстрації містить власні діаграми, формули, підписи та дрібний текст — відтворені за один раз, а не зібрані після обробки.
Це єдина модель, здатна досягти цього без серйозних помилок.
Друга частина — це те, що компанія називає автентичними деталями. За словами Alibaba, модель "підтримує точне відтворення тексту розміром до 10 пікселів, яскраво відтворюючи такі деталі, як пори та волоски, з реалістичним мікрорівневим зображенням." Десять пікселів — це дрібний шрифт, такий, який можна побачити у фармацевтичних застереженнях. Модель також точно обробляє LaTeX — систему позначень, яку дослідники використовують для написання складних математичних рівнянь — на повних макетах академічних статей.
У наших звичайних тестах ми даємо моделям кілька речень і оцінюємо, як вони їх обробляють. Qwen Image 3.0 зміг згенерувати зображення нижче, згідно з офіційним блогом Alibaba.

Ми спробували цю функцію, використовуючи найшвидшу конфігурацію моделі. Qwen Image 3.0 зміг відтворити одну повну статтю з Decrypt. Виконання було справді вражаючим, але результат не був бездоганним.

Третій стовп Qwen Image 3.0 — це глибокі знання. За словами команди Qwen, модель «підтримує нативне відтворення 12 мов, симулює основні інтерфейси, такі як веб-сторінки, ігри та прямі трансляції, і спирається на багаті знання про світ». Вона також підключається до Інтернету для отримання актуальних даних, тож запит на візуалізацію прогнозу погоди для конкретного міста та дати повертає точну графіку, а не здогадку.
Наприклад, Alibaba поділилася фотографією комахи на листку. Модель змогла згенерувати відповідний текст на основі свого розуміння зображення.

Alibaba пропонує дизайн-студіям, контент-командам, операторам електронної комерції та освітянам, яким потрібні готові до виробництва візуальні активи у великих обсягах.
Варто зазначити, що у власній оцінці Alibaba Qwen-Image-Bench — бенчмарку, який оцінює якість зображень, естетику та відповідність реальному світу серед 18 моделей — Qwen Image 2.0 Pro, попередній флагман, посів п'яте місце. GPT Image 2 від OpenAI очолив рейтинг. Нова модель може працювати краще, але запуск не дає вимірюваного способу це підтвердити, оскільки вона вийшла без таблиці бенчмарків, завантажуваних ваг або технічного звіту.
Qwen Image 1.0 вийшов з відкритими вагами під ліцензією Apache 2.0 та технічним звітом того ж дня. Цього разу цього не було. У рамках нещодавнього AI-наступу Alibaba докази тут повністю складаються з ретельно відібраних прикладів зображень, які компанія вирішила опублікувати. API-тести відкриті на chat.qwen.ai. Ціни ще не оголошені.






