W skrócie

  • OpenDesign Arena oceniło DeepSeek V4.1 Flash na 81,2 punktu na 100 w rzeczywistych zadaniach projektowych, co stanowi 98% wyniku GPT-6 Astra wynoszącego 82,7, przy jednoczesnym pobieraniu opłaty w wysokości 0,023 USD za ukończony projekt w porównaniu do 1,61 USD w przypadku Astra.
  • Spośród 13 przetestowanych modeli — w tym Claude Fable 5.1, Grok 4.6 i Qwen 3.8-Max — 11 uzyskało niższy wynik niż model DeepSeek i kosztowało więcej w eksploatacji. Tylko GPT-6 Astra uzyskał wyższy wynik.
  • Dokumentacja techniczna DeepSeek dla V4.1 Flash pokazuje, że model aktywuje zaledwie 8 miliardów ze swoich 552 miliardów parametrów do odczytania promptu, co jest decyzją projektową stojącą za jego niską ceną.

OpenDesign, firma stojąca za stroną benchmarkową OpenDesign Arena, przeprowadziła w tym tygodniu 13 modeli AI przez tę samą partię zadań projektowych. Najwyżej ocenionym był GPT-6 Astra od OpenAI. Jednak najnowszy model DeepSeek, V4.1 Flash, osiągnął 98% tego najwyższego wyniku, pobierając około 1,4% najwyższej ceny.

OpenDesign Arena ocenia modele w codziennej pracy projektowej — budowaniu aplikacji internetowych, pulpitów nawigacyjnych, ekranów mobilnych i stron docelowych — w skali do 100 punktów. Trzydzieści z tych punktów sprawdza, czy wynik faktycznie spełnia założenia; pozostałe 70 ocenia jakość projektu pod względem układu, hierarchii, kolorów i dopasowania stylu.

Myriad: Jak wysoko będzie handlowany Nvidia we wrześniu? Kliknij, aby dokonać prognozy.
Myriad: Jak wysoko będzie handlowany Nvidia we wrześniu? Kliknij, aby dokonać prognozy.

Został stworzony, aby odpowiedzieć na węższe pytanie niż większość rankingów AI: którego modelu powinien jutro faktycznie użyć pracujący projektant stron internetowych.

W tej skali GPT-6 Astra uzyskał średnio 82,7 punktu, zajmując 11,1 minuty i kosztując 1,61 dolara za ukończony projekt. DeepSeek V4.1 Flash zdobył 81,2 punktu, ukończył zadanie w 5,3 minuty i kosztował 0,023 dolara. Claude Fable 5.1 uzyskał 80,3 punktu, zajął 12,8 minuty i kosztował 3,66 dolara.

Każdy inny model testowany przez OpenDesign — Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash i Gemini 3.8 Flash wśród nich — uzyskał niższy wynik niż DeepSeek V4.1 Flash i kosztował więcej w eksploatacji. To 11 z 13 testowanych modeli. Tylko GPT-6 Astra pokonał go bezpośrednio, i to tylko o półtora punktu.

Raport techniczny DeepSeek dla V4.1 Flash wyjaśnia, skąd pochodzą oszczędności. Model zawiera łącznie 552 miliardy parametrów — wewnętrznych ustawień, które model dostraja podczas treningu, aby przechowywać to, czego się nauczył — ale budzi tylko 8 miliardów z nich, aby odczytać przychodzący prompt, i 16 miliardów, aby napisać odpowiedź. DeepSeek nazywa to projektem Causal Encoder-Decoder i to ten sam trik stojący za szybkimi czasami ukończenia modelu.

To nie jest pierwsze podejście DeepSeek do zamykania luki kompetencyjnej tanim kosztem. Kilka tygodni wcześniej model V4 Pro tej firmy znalazł się w granicach 5% od Claude Fable 5 w osobnym porównaniu benchmarkowym, pobierając przy tym ułamek stawki Fable. DeepSeek rekrutuje także inżynierów w Pekinie, aby zbudować własny Code Harness, dążąc do posiadania pełnego stosu agentowego, a nie tylko dostarczania modelu pod nim.

Konfiguracja testowa OpenDesign zawęża to, co te liczby mogą udowodnić. Wynik modelu jest oceniany tylko wtedy, gdy w ogóle renderuje się jako działająca strona internetowa; wszystko puste, zepsute lub ucięte otrzymuje zero i nie jest ponownie testowane. Oznacza to, że benchmark mierzy niezawodny, codzienny wynik projektowy, a nie ogólne rozumowanie czy umiejętności kodowania.

GPT-6 Astra, który OpenAI wydało 3 września, już cieszy się reputacją robienia po trochu wszystkiego — rozplanowania płytki drukowanej, sporządzenia zeznania podatkowego, zbudowania sceny 3D — ale wcześni testerzy wskazywali go jako słabszego pisarza niż model, który zastąpił. Jego cena i tempo na wykresie OpenDesign pasują do tego samego projektu generalisty: wolniejszy i droższy niż tańsza propozycja DeepSeek, ale wciąż najwyżej punktujący w tym zestawieniu.

Wskaźnik dostarczalności DeepSeek V4.1 Flash—udział wyników, które OpenDesign uznał za gotowe do przekazania bez poprawek—wyniósł 57,7%. Wskaźnik dostarczalności GPT-6 Astra wyniósł 60%. Wskaźnik dostarczalności Claude Fable 5.1 wyniósł 56,7%.