In Kürze
- OpenDesign Arena bewertete DeepSeek V4.1 Flash mit 81,2 von 100 Punkten bei realen Designaufgaben, 98 % von GPT-6 Astras 82,7, während es 0,023 $ pro fertigem Design berechnete gegenüber Astras 1,61 $.
- Von den 13 getesteten Modellen – darunter Claude Fable 5.1, Grok 4.6 und Qwen 3.8-Max – erzielten 11 niedrigere Werte als DeepSeeks Modell und kosteten mehr im Betrieb. Nur GPT-6 Astra erzielte einen höheren Wert.
- DeepSeeks technisches Papier zu V4.1 Flash zeigt, dass das Modell nur 8 Milliarden seiner 552 Milliarden Parameter aktiviert, um eine Eingabeaufforderung zu lesen – die Designentscheidung hinter seinem niedrigen Preis.
OpenDesign, das Unternehmen hinter der Benchmark-Website OpenDesign Arena, ließ diese Woche 13 KI-Modelle durch dieselbe Charge von Designaufgaben laufen. Der Spitzenreiter war OpenAIs GPT-6 Astra. Aber DeepSeeks neuestes Modell, V4.1 Flash, erreichte 98 % dieser Spitzenpunktzahl, während es etwa 1,4 % des Spitzenpreises berechnete.
OpenDesign Arena bewertet Modelle bei alltäglicher Designarbeit – dem Erstellen von Web-Apps, Dashboards, mobilen Bildschirmen und Landingpages – mit bis zu 100 Punkten. Dreißig dieser Punkte prüfen, ob die Ausgabe tatsächlich die Vorgaben erfüllt; die anderen 70 bewerten die Designqualität hinsichtlich Layout, Hierarchie, Farbe und Stilpassung.

Es wurde entwickelt, um eine engere Frage zu beantworten, als die meisten KI-Bestenlisten stellen: Welches Modell sollte ein berufstätiger Webdesigner morgen tatsächlich verwenden.
In diesem Maßstab erreichte GPT-6 Astra durchschnittlich 82,7 Punkte, benötigte 11,1 Minuten und kostete 1,61 $ pro fertiggestelltem Design. DeepSeek V4.1 Flash erzielte 81,2 Punkte, erledigte die Aufgabe in 5,3 Minuten und kostete 0,023 $. Claude Fable 5.1 kam auf 80,3 Punkte, benötigte 12,8 Minuten und kostete 3,66 $.

Jedes andere Modell, das OpenDesign getestet hat – darunter Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash und Gemini 3.8 Flash – erzielte niedrigere Werte als DeepSeek V4.1 Flash und war teurer im Betrieb. Das sind 11 der 13 getesteten Modelle. Nur GPT-6 Astra übertraf es direkt, und das nur um eineinhalb Punkte.
Der technische Bericht von DeepSeek zu V4.1 Flash erklärt, woher die Einsparungen kommen. Das Modell verfügt insgesamt über 552 Milliarden Parameter – die internen Einstellungen, die ein Modell während des Trainings anpasst, um das Gelernte zu speichern –, aktiviert aber nur 8 Milliarden davon, um eine eingehende Eingabeaufforderung zu lesen, und 16 Milliarden, um die Antwort zu schreiben. DeepSeek nennt dies ein Causal-Encoder-Decoder-Design, und es ist derselbe Trick, der hinter den schnellen Fertigstellungszeiten des Modells steckt.
Dies ist nicht DeepSeeks erster Versuch, eine Fähigkeitslücke kostengünstig zu schließen. Wochen zuvor landete das V4 Pro-Modell des Unternehmens innerhalb von 5 % von Claude Fable 5 bei einem separaten Benchmark-Vergleich, während es nur einen Bruchteil von Fables Preis verlangte. DeepSeek rekrutiert außerdem Ingenieure in Peking, um einen eigenen Code Harness zu entwickeln, mit dem Ziel, den gesamten agentischen Stack zu besitzen, anstatt nur das darunterliegende Modell zu liefern.
Der Testaufbau von OpenDesign schränkt ein, was diese Zahlen beweisen können. Die Ausgabe eines Modells wird nur bewertet, wenn sie überhaupt als funktionierende Webseite gerendert wird; alles Leere, Kaputte oder Abgeschnittene erhält null Punkte und wird nicht erneut getestet. Das bedeutet, dass der Benchmark zuverlässige, alltägliche Design-Ausgaben misst, nicht allgemeine Denk- oder Programmierfähigkeiten.
GPT-6 Astra, das OpenAI am 3. September veröffentlichte, hat bereits den Ruf, ein bisschen von allem zu können – eine Platine entwerfen, eine Steuererklärung aufsetzen, eine 3D-Szene erstellen –, aber frühe Tester bemängelten, dass es ein schwächerer Schreiber sei als das Modell, das es ersetzte. Sein Preis und sein Tempo in OpenDesigns Diagramm passen zu demselben generalistischen Design: langsamer und teurer als DeepSeeks günstigerer Einstieg, aber immer noch der höchste Punktwert im Feld.
Die Lieferrate von DeepSeek V4.1 Flash – der Anteil der Ausgaben, die OpenDesign als bereit zur Übergabe ohne Überarbeitung beurteilte – lag bei 57,7 %. Die Lieferrate von GPT-6 Astra betrug 60 %. Die von Claude Fable 5.1 betrug 56,7 %.






