简讯

  • OpenDesign Arena 在真实世界设计任务中给 DeepSeek V4.1 Flash 打出了 81.2 分(满分 100 分),达到 GPT-6 Astra 82.7 分的 98%,而每个完成的设计收费 0.023 美元,Astra 则为 1.61 美元。
  • 在测试的 13 个模型中——包括 Claude Fable 5.1、Grok 4.6 和 Qwen 3.8-Max——有 11 个得分低于 DeepSeek 的模型,且运行成本更高。只有 GPT-6 Astra 得分更高。
  • DeepSeek 为 V4.1 Flash 发布的技术论文显示,该模型在读取提示时仅激活其 5520 亿参数中的 80 亿,这正是其低价格背后的设计选择。

基准测试网站 OpenDesign Arena 背后的公司 OpenDesign 本周让 13 个 AI 模型运行了同一批设计任务。得分最高的是 OpenAI 的 GPT-6 Astra。但 DeepSeek 的最新模型 V4.1 Flash 达到了最高分的 98%,而收费仅为最高价格的约 1.4%。

OpenDesign Arena 对模型在日常设计工作——构建 Web 应用、仪表盘、移动端界面和落地页——中的表现进行百分制评分。其中 30 分检查输出是否真正满足需求;另外 70 分则根据布局、层级、色彩和风格契合度来评定设计质量。

Myriad:英伟达9月股价会涨到多高?点击做出你的预测。
Myriad:英伟达9月股价会涨到多高?点击做出你的预测

它旨在回答一个比大多数AI排行榜所问的更具体的问题:一位在职网页设计师明天究竟应该使用哪个模型。

在这个标准下,GPT-6 Astra平均得分82.7分,耗时11.1分钟,每个完成的设计花费1.61美元。DeepSeek V4.1 Flash得分81.2分,5.3分钟完成工作,花费0.023美元。Claude Fable 5.1得分为80.3分,耗时12.8分钟,花费3.66美元。

OpenDesign 测试的其他所有模型——其中包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash——得分都低于 DeepSeek V4.1 Flash,且运行成本更高。在测试的 13 个模型中,有 11 个如此。只有 GPT-6 Astra 直接击败了它,而且仅领先一分半。

DeepSeek 为 V4.1 Flash 发布的技术报告解释了节省成本的来源。该模型总共有 5520 亿个参数——即模型在训练期间调整以存储所学内容的内部设置——但只唤醒其中 80 亿个来读取传入的提示,并唤醒 160 亿个来撰写回复。DeepSeek 称这是一种因果编码器-解码器设计,这也是该模型快速完成时间背后的相同技巧。

这并非 DeepSeek 首次以低成本缩小能力差距。几周前,该公司的 V4 Pro 模型在另一项基准比较中达到 Claude Fable 5 的 5% 以内,而收费仅为 Fable 费率的一小部分。DeepSeek 还一直在北京招募工程师来构建自己的 Code Harness,旨在拥有完整的智能体技术栈,而不仅仅是提供其底层的模型。

OpenDesign 的测试设置限制了这些数字所能证明的内容。只有当模型的输出首先能渲染为可用的网页时,才会被评分;任何空白、损坏或被截断的内容都得零分,并且不会重新测试。这意味着该基准衡量的是可靠的日常设计输出,而非通用推理或编码技能。

OpenAI 于 9 月 3 日发布的 GPT-6 Astra 已经以样样通而闻名——布置电路板、起草纳税申报表、构建 3D 场景——但早期测试者指出,它的写作能力比它所取代的模型更弱。它在 OpenDesign 图表上的价格和速度符合同样的通才设计:比 DeepSeek 更便宜的入门款更慢、更贵,但仍是该领域得分最高的。

DeepSeek V4.1 Flash 的交付率——即 OpenDesign 判定无需修改即可直接交付的输出占比——为 57.7%。GPT-6 Astra 的交付率为 60%。Claude Fable 5.1 的交付率为 56.7%。