Коротко
- OpenDesign Arena оцінила DeepSeek V4.1 Flash у 81,2 зі 100 балів на реальних дизайнерських завданнях — це 98% від 82,7 у GPT-6 Astra, при цьому вартість становить $0,023 за завершений дизайн проти $1,61 в Astra.
- З 13 протестованих моделей — включно з Claude Fable 5.1, Grok 4.6 і Qwen 3.8-Max — 11 набрали менше балів, ніж модель DeepSeek, і коштували дорожче в роботі. Лише GPT-6 Astra набрала більше балів.
- Технічна стаття DeepSeek про V4.1 Flash показує, що модель активує лише 8 мільярдів зі своїх 552 мільярдів параметрів для читання запиту — саме це архітектурне рішення зумовлює її низьку ціну.
OpenDesign, компанія, що стоїть за сайтом бенчмарків OpenDesign Arena, цього тижня прогнала 13 AI-моделей через однаковий набір дизайнерських завдань. Найвищий бал отримала GPT-6 Astra від OpenAI. Але найновіша модель DeepSeek, V4.1 Flash, досягла 98% від цього найвищого балу, стягуючи при цьому близько 1,4% від найвищої ціни.
OpenDesign Arena оцінює моделі за повсякденною дизайнерською роботою — створенням вебзастосунків, дашбордів, мобільних екранів і лендінгів — за 100-бальною шкалою. Тридцять із цих балів перевіряють, чи справді результат відповідає технічному завданню; решта 70 оцінюють якість дизайну за компонуванням, ієрархією, кольором і відповідністю стилю.

Він створений, щоб відповісти на вужче питання, ніж те, яке ставлять більшість рейтингів ШІ: яку модель має насправді використовувати завтра працюючий веб-дизайнер.
За цією шкалою GPT-6 Astra набрав у середньому 82,7 бала, витративши 11,1 хвилини та 1,61 долара на завершений дизайн. DeepSeek V4.1 Flash отримав 81,2 бала, завершив роботу за 5,3 хвилини та коштував 0,023 долара. Claude Fable 5.1 отримав 80,3 бала, витратив 12,8 хвилини та коштував 3,66 долара.

Кожна інша модель, яку тестувала OpenDesign — серед них Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash і Gemini 3.8 Flash — набрала менше балів, ніж DeepSeek V4.1 Flash, і коштувала дорожче в роботі. Це 11 із 13 протестованих моделей. Лише GPT-6 Astra перевершила її беззаперечно, і лише на півтора бала.
Технічний звіт DeepSeek щодо V4.1 Flash пояснює, звідки береться економія. Модель містить загалом 552 мільярди параметрів — внутрішніх налаштувань, які модель підлаштовує під час навчання, щоб зберігати вивчене — але активує лише 8 мільярдів із них, щоб прочитати вхідний запит, і 16 мільярдів, щоб написати відповідь. DeepSeek називає це дизайном Causal Encoder-Decoder, і це той самий прийом, що стоїть за швидким часом завершення моделі.
Це не перша спроба DeepSeek закрити розрив у можливостях задешево. Кількома тижнями раніше модель компанії V4 Pro опинилася в межах 5% від Claude Fable 5 в окремому порівнянні за бенчмарками, стягуючи при цьому частку від тарифу Fable. DeepSeek також наймала інженерів у Пекіні, щоб створити власний Code Harness, прагнучи володіти всім агентним стеком, а не лише постачати модель під ним.
Тестове налаштування OpenDesign звужує те, що можуть довести ці цифри. Результат моделі оцінюється лише якщо він взагалі відображається як робоча вебсторінка; усе порожнє, зламане або обрізане отримує нуль і не перевіряється повторно. Це означає, що бенчмарк вимірює надійний, повсякденний результат дизайну, а не загальне міркування чи навички кодування.
GPT-6 Astra, яку OpenAI випустила 3 вересня, вже має репутацію моделі, що робить потроху всього — розводить плату, складає податкову декларацію, будує 3D-сцену — але ранні тестувальники відзначили її як слабшого письменника, ніж модель, яку вона замінила. Її ціна та швидкість на графіку OpenDesign відповідають тому самому універсальному дизайну: повільніша й дорожча, ніж дешевший варіант DeepSeek, але все ще найвищий результат у цій галузі.
Показник готовності до видачі DeepSeek V4.1 Flash — частка результатів, які OpenDesign визнав готовими до передачі без доопрацювання — становив 57,7%. Показник готовності до видачі GPT-6 Astra становив 60%. У Claude Fable 5.1 він становив 56,7%.






