簡述

  • OpenDesign Arena 在真實世界設計任務中給 DeepSeek V4.1 Flash 打出 81.2 分(滿分 100),達到 GPT-6 Astra 82.7 分的 98%,而每個完成設計的收費為 $0.023,Astra 則為 $1.61。
  • 在受測的 13 個模型中——包括 Claude Fable 5.1、Grok 4.6 和 Qwen 3.8-Max——有 11 個得分低於 DeepSeek 的模型,且運行成本更高。只有 GPT-6 Astra 得分更高。
  • DeepSeek 為 V4.1 Flash 發表的技術論文顯示,該模型在讀取提示時僅啟動其 5520 億個參數中的 80 億個,這正是其低價背後的設計選擇。

OpenDesign 是基準測試網站 OpenDesign Arena 背後的公司,本週讓 13 個 AI 模型跑同一批設計任務。得分最高的是 OpenAI 的 GPT-6 Astra。但 DeepSeek 的最新模型 V4.1 Flash 達到了最高分的 98%,而收費僅約最高價的 1.4%。

OpenDesign Arena 以 100 分制為日常設計工作評分——包括建構網頁應用程式、儀表板、行動裝置畫面與登陸頁面。其中 30 分檢查輸出是否真正符合需求;另外 70 分則評估版面配置、層級、色彩與風格契合度等設計品質。

Myriad:Nvidia 在九月會交易到多高?點擊做出你的預測。
Myriad:Nvidia 在九月會交易到多高? 點擊做出你的預測

它的設計是為了回答一個比大多數 AI 排行榜所問的更狹窄的問題:一位在職的網頁設計師明天實際上應該使用哪個模型。

在那個尺度上,GPT-6 Astra 平均得到 82.7 分,每完成一個設計耗時 11.1 分鐘、花費 1.61 美元。DeepSeek V4.1 Flash 得分 81.2,在 5.3 分鐘內完成工作,花費 0.023 美元。Claude Fable 5.1 得分 80.3,耗時 12.8 分鐘,花費 3.66 美元。

OpenDesign 測試的其他所有模型——其中包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash——得分都低於 DeepSeek V4.1 Flash,且運行成本更高。這在受測的 13 個模型中占了 11 個。只有 GPT-6 Astra 直接擊敗了它,而且僅領先一分半。

DeepSeek 針對 V4.1 Flash 的技術報告解釋了節省成本的來源。該模型總共擁有 5,520 億個參數——這是模型在訓練期間調整以儲存所學內容的內部設定——但只會喚醒其中 80 億個來讀取傳入的提示,並喚醒 160 億個來撰寫回應。DeepSeek 稱之為因果編碼器-解碼器設計,而這正是該模型快速完成時間背後的相同技巧。

這並非 DeepSeek 首次以低成本縮小能力差距。數週前,該公司的 V4 Pro 模型在另一項基準比較中,以遠低於 Claude Fable 5 收費的價格,達到與其相差 5% 以內的表現。DeepSeek 也一直在北京招募工程師,以打造自家的 Code Harness,目標是擁有完整的代理堆疊,而不只是提供其下方的模型。

OpenDesign 的測試設定限制了這些數字所能證明的範圍。模型的輸出只有在首先能呈現為可運作的網頁時才會被評分;任何空白、損壞或被截斷的內容都會得零分,且不會重新測試。這意味著該基準衡量的是可靠、日常的設計輸出,而非一般推理或程式設計技能。

OpenAI 於 9 月 3 日發布的 GPT-6 Astra,早已以樣樣通而聞名——無論是佈局電路板、起草報稅表,還是建構 3D 場景——但早期測試者指出,它的寫作能力比它所取代的模型更弱。它在 OpenDesign 圖表上的價格與速度也符合這種通才設計:比 DeepSeek 更便宜的入門款更慢、更貴,但仍是該領域得分最高的模型。

DeepSeek V4.1 Flash 的交付率——即 OpenDesign 判定無需修改即可直接交付的輸出佔比——為 57.7%。GPT-6 Astra 的交付率為 60%。Claude Fable 5.1 的交付率為 56.7%。