Кратко

  • OpenDesign Arena оценила DeepSeek V4.1 Flash в 81,2 балла из 100 на реальных задачах дизайна — это 98% от 82,7 балла GPT-6 Astra, при этом стоимость одного готового дизайна составляет $0,023 против $1,61 у Astra.
  • Из 13 протестированных моделей — включая Claude Fable 5.1, Grok 4.6 и Qwen 3.8-Max — 11 набрали меньше баллов, чем модель DeepSeek, и обошлись дороже в эксплуатации. Только GPT-6 Astra набрала больше баллов.
  • Техническая статья DeepSeek о V4.1 Flash показывает, что модель активирует лишь 8 миллиардов из своих 552 миллиардов параметров для чтения запроса — именно это архитектурное решение лежит в основе её низкой цены.

OpenDesign, компания, стоящая за сайтом-бенчмарком OpenDesign Arena, на этой неделе прогнала 13 ИИ-моделей через одну и ту же партию задач по дизайну. Лучший результат показала GPT-6 Astra от OpenAI. Но новейшая модель DeepSeek, V4.1 Flash, достигла 98% от этого лучшего результата, запрашивая при этом около 1,4% от лучшей цены.

OpenDesign Arena оценивает модели по повседневной дизайнерской работе — созданию веб-приложений, дашбордов, мобильных экранов и лендингов — по 100-балльной шкале. Тридцать из этих баллов проверяют, действительно ли результат соответствует заданию; остальные 70 оценивают качество дизайна по компоновке, иерархии, цвету и соответствию стилю.

Myriad: Как высоко будет торговаться Nvidia в сентябре? Нажмите, чтобы сделать свой прогноз.
Myriad: Как высоко будет торговаться Nvidia в сентябре? Нажмите, чтобы сделать свой прогноз.

Он создан, чтобы ответить на более узкий вопрос, чем задаёт большинство рейтингов ИИ: какую модель работающий веб-дизайнер действительно должен использовать завтра.

По этой шкале GPT-6 Astra набрала в среднем 82,7 балла, затратив 11,1 минуты и 1,61 доллара на завершённый дизайн. DeepSeek V4.1 Flash набрала 81,2 балла, выполнила работу за 5,3 минуты и стоила 0,023 доллара. Claude Fable 5.1 получила 80,3 балла, потратила 12,8 минуты и стоила 3,66 доллара.

Все остальные модели, которые тестировала OpenDesign — среди них Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash и Gemini 3.8 Flash — набрали меньше баллов, чем DeepSeek V4.1 Flash, и стоили дороже в эксплуатации. Это 11 из 13 протестированных моделей. Только GPT-6 Astra превзошла её напрямую, и всего лишь на полтора балла.

Технический отчёт DeepSeek по V4.1 Flash объясняет, откуда берётся экономия. Модель содержит в общей сложности 552 миллиарда параметров — внутренних настроек, которые модель подстраивает во время обучения, чтобы хранить усвоенное, — но активирует только 8 миллиардов из них для чтения входящего запроса и 16 миллиардов для написания ответа. DeepSeek называет это архитектурой Causal Encoder-Decoder, и это тот же приём, который обеспечивает быстрое время завершения работы модели.

Это не первая попытка DeepSeek закрыть разрыв в возможностях за небольшие деньги. Несколькими неделями ранее модель компании V4 Pro оказалась в пределах 5% от Claude Fable 5 в отдельном сравнительном тесте, при этом взимая лишь часть ставки Fable. DeepSeek также набирала инженеров в Пекине для создания собственного Code Harness, стремясь владеть всем агентным стеком, а не просто поставлять модель, лежащую в его основе.

Тестовая конфигурация OpenDesign сужает то, что могут доказать эти цифры. Вывод модели получает оценку только в том случае, если он вообще отображается как работающая веб-страница; всё пустое, сломанное или обрезанное получает ноль и не перепроверяется. Это означает, что бенчмарк измеряет надёжный, повседневный дизайнерский вывод, а не общие навыки рассуждения или программирования.

GPT-6 Astra, которую OpenAI выпустила 3 сентября, уже имеет репутацию модели, делающей понемногу всего — разводящей печатную плату, составляющей налоговую декларацию, строящей 3D-сцену, — но ранние тестировщики отметили её как более слабого писателя, чем модель, которую она заменила. Её цена и темп на графике OpenDesign соответствуют тому же универсальному дизайну: медленнее и дороже, чем более дешёвое предложение DeepSeek, но всё ещё самый высокий результат в этой области.

Показатель готовности к выдаче DeepSeek V4.1 Flash — доля выходных данных, которые OpenDesign признал готовыми к передаче без доработки — составил 57,7%. Показатель готовности к выдаче GPT-6 Astra составил 60%. У Claude Fable 5.1 он составил 56,7%.