En bref
- OpenDesign Arena a attribué à DeepSeek V4.1 Flash une note de 81,2 sur 100 sur des tâches de design réelles, soit 98 % des 82,7 de GPT-6 Astra, tout en facturant 0,023 $ par design finalisé contre 1,61 $ pour Astra.
- Sur les 13 modèles testés—dont Claude Fable 5.1, Grok 4.6 et Qwen 3.8-Max—11 ont obtenu un score inférieur à celui du modèle de DeepSeek et ont coûté plus cher à exécuter. Seul GPT-6 Astra a obtenu un score supérieur.
- L'article technique de DeepSeek pour V4.1 Flash montre que le modèle n'active que 8 milliards de ses 552 milliards de paramètres pour lire une invite, le choix de conception derrière son prix bas.
OpenDesign, l'entreprise derrière le site de référence OpenDesign Arena, a fait passer 13 modèles d'IA par le même lot de tâches de design cette semaine. Le meilleur score a été obtenu par GPT-6 Astra d'OpenAI. Mais le tout nouveau modèle de DeepSeek, V4.1 Flash, a atteint 98 % de ce score maximal tout en facturant environ 1,4 % du prix maximal.
OpenDesign Arena note les modèles sur le travail de design quotidien—création d'applications web, de tableaux de bord, d'écrans mobiles et de pages de destination—sur 100 points. Trente de ces points vérifient si le résultat répond réellement au brief ; les 70 autres évaluent la qualité du design sur la mise en page, la hiérarchie, la couleur et l'adéquation du style.

Il est conçu pour répondre à une question plus précise que celle que posent la plupart des classements d'IA : quel modèle un concepteur web en activité devrait réellement utiliser demain.
Sur cette échelle, GPT-6 Astra a obtenu une moyenne de 82,7 points, en prenant 11,1 minutes et 1,61 $ par design terminé. DeepSeek V4.1 Flash a obtenu 81,2, a terminé le travail en 5,3 minutes et a coûté 0,023 $. Claude Fable 5.1 est arrivé à 80,3, a pris 12,8 minutes et a coûté 3,66 $.

Tous les autres modèles testés par OpenDesign—Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash et Gemini 3.8 Flash parmi eux—ont obtenu un score inférieur à DeepSeek V4.1 Flash et coûtent plus cher à exécuter. Cela représente 11 des 13 modèles testés. Seul GPT-6 Astra l'a battu outright, et seulement d'un point et demi.
Le rapport technique de DeepSeek pour V4.1 Flash explique d'où viennent les économies. Le modèle porte 552 milliards de paramètres au total—les réglages internes qu'un modèle ajuste pendant l'entraînement pour stocker ce qu'il a appris—mais n'en réveille que 8 milliards pour lire une invite entrante et 16 milliards pour écrire la réponse. DeepSeek appelle cela une conception Causal Encoder-Decoder, et c'est le même tour de passe-passe derrière les temps de complétion rapides du modèle.
Ce n'est pas la première tentative de DeepSeek pour combler un écart de capacité à moindre coût. Quelques semaines plus tôt, le modèle V4 Pro de l'entreprise a atterri à moins de 5% de Claude Fable 5 sur une comparaison de benchmark distincte tout en facturant une fraction du tarif de Fable. DeepSeek a également recruté des ingénieurs à Pékin pour construire son propre Code Harness, visant à posséder la pile agentique complète au lieu de simplement fournir le modèle en dessous.
La configuration de test d'OpenDesign limite ce que ces chiffres peuvent prouver. La sortie d'un modèle n'est notée que si elle s'affiche d'abord comme une page web fonctionnelle ; tout ce qui est vide, cassé ou coupé obtient un zéro et n'est pas retesté. Cela signifie que le benchmark mesure une sortie de conception fiable et quotidienne, pas un raisonnement général ou une compétence de codage.
GPT-6 Astra, qu'OpenAI a publié le 3 septembre, porte déjà une réputation de faire un peu de tout—disposer une carte de circuit imprimé, rédiger une déclaration de revenus, construire une scène 3D—mais les premiers testeurs l'ont signalé comme un rédacteur plus faible que le modèle qu'il a remplacé. Son prix et son rythme sur le graphique d'OpenDesign correspondent à cette même conception généraliste : plus lent et plus cher que l'entrée moins chère de DeepSeek, mais toujours le score le plus élevé du domaine.
Le taux de livraison de DeepSeek V4.1 Flash — la part des sorties qu'OpenDesign a jugées prêtes à être transmises sans révision — s'est établi à 57,7 %. Le taux de livraison de GPT-6 Astra était de 60 %. Celui de Claude Fable 5.1 était de 56,7 %.






