Em resumo
- O OpenDesign Arena atribuiu ao DeepSeek V4.1 Flash uma pontuação de 81,2 de 100 em tarefas de design do mundo real, 98% da pontuação de 82,7 do GPT-6 Astra, enquanto cobra US$ 0,023 por design finalizado contra US$ 1,61 do Astra.
- Dos 13 modelos testados — incluindo Claude Fable 5.1, Grok 4.6 e Qwen 3.8-Max — 11 pontuaram abaixo do modelo da DeepSeek e custaram mais para executar. Apenas o GPT-6 Astra pontuou mais alto.
- O artigo técnico da DeepSeek para o V4.1 Flash mostra que o modelo ativa apenas 8 bilhões de seus 552 bilhões de parâmetros para ler um prompt, a escolha de design por trás de seu baixo preço.
A OpenDesign, empresa por trás do site de benchmark OpenDesign Arena, testou 13 modelos de IA no mesmo lote de tarefas de design esta semana. O maior pontuador foi o GPT-6 Astra da OpenAI. Mas o modelo mais novo da DeepSeek, o V4.1 Flash, alcançou 98% dessa pontuação máxima enquanto cobrava cerca de 1,4% do preço máximo.
O OpenDesign Arena pontua modelos em trabalho de design cotidiano — construção de aplicativos web, painéis, telas móveis e páginas de destino — em uma escala de 100 pontos. Trinta desses pontos verificam se o resultado realmente atende ao briefing; os outros 70 avaliam a qualidade do design em layout, hierarquia, cor e adequação de estilo.

Ele foi criado para responder a uma pergunta mais específica do que a maioria dos rankings de IA faz: qual modelo um designer web em atividade deveria realmente usar amanhã.
Nessa escala, o GPT-6 Astra teve uma média de 82,7 pontos, levando 11,1 minutos e US$ 1,61 por design finalizado. O DeepSeek V4.1 Flash marcou 81,2, concluiu o trabalho em 5,3 minutos e custou US$ 0,023. O Claude Fable 5.1 ficou com 80,3, levou 12,8 minutos e custou US$ 3,66.

Todos os outros modelos testados pela OpenDesign—Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash e Gemini 3.8 Flash entre eles—obtiveram pontuação inferior ao DeepSeek V4.1 Flash e custaram mais para rodar. Isso representa 11 dos 13 modelos testados. Apenas o GPT-6 Astra o superou de forma direta, e apenas por um ponto e meio.
O relatório técnico do DeepSeek para o V4.1 Flash explica de onde vêm as economias. O modelo carrega 552 bilhões de parâmetros no total—as configurações internas que um modelo ajusta durante o treinamento para armazenar o que aprendeu—mas ativa apenas 8 bilhões deles para ler um prompt recebido e 16 bilhões para escrever a resposta. A DeepSeek chama isso de design Causal Encoder-Decoder, e é o mesmo truque por trás dos tempos de conclusão rápidos do modelo.
Esta não é a primeira tentativa da DeepSeek de fechar uma lacuna de capacidade gastando pouco. Semanas antes, o modelo V4 Pro da empresa ficou dentro de 5% do Claude Fable 5 em uma comparação de benchmark separada, enquanto cobrava uma fração da tarifa do Fable. A DeepSeek também vem recrutando engenheiros em Pequim para construir seu próprio Code Harness, com o objetivo de dominar toda a pilha agêntica em vez de apenas fornecer o modelo por baixo dela.
A configuração de testes da OpenDesign restringe o que esses números podem provar. A saída de um modelo só é pontuada se for renderizada como uma página web funcional em primeiro lugar; qualquer coisa em branco, quebrada ou cortada recebe zero e não é testada novamente. Isso significa que o benchmark mede a produção de design confiável e cotidiana, não raciocínio geral ou habilidade de programação.
O GPT-6 Astra, que a OpenAI lançou em 3 de setembro, já carrega a reputação de fazer um pouco de tudo—montar uma placa de circuito, preencher uma declaração de imposto de renda, construir uma cena 3D—mas os primeiros testadores o apontaram como um escritor mais fraco do que o modelo que ele substituiu. Seu preço e ritmo no gráfico da OpenDesign se encaixam nesse mesmo design generalista: mais lento e mais caro do que a entrada mais barata da DeepSeek, mas ainda assim o maior pontuador do campo.
A taxa de entrega do DeepSeek V4.1 Flash — a parcela de resultados que o OpenDesign considerou prontos para serem entregues sem revisão — ficou em 57,7%. A taxa de entrega do GPT-6 Astra foi de 60%. A do Claude Fable 5.1 foi de 56,7%.






