En resumen

  • OpenDesign Arena calificó a DeepSeek V4.1 Flash con 81.2 sobre 100 en tareas de diseño del mundo real, el 98% de los 82.7 de GPT-6 Astra, mientras cobraba $0.023 por diseño terminado frente a los $1.61 de Astra.
  • De los 13 modelos probados—incluyendo Claude Fable 5.1, Grok 4.6 y Qwen 3.8-Max—11 obtuvieron puntuaciones más bajas que el modelo de DeepSeek y costaron más de ejecutar. Solo GPT-6 Astra obtuvo una puntuación más alta.
  • El artículo técnico de DeepSeek para V4.1 Flash muestra que el modelo activa solo 8 mil millones de sus 552 mil millones de parámetros para leer un prompt, la decisión de diseño detrás de su bajo precio.

OpenDesign, la empresa detrás del sitio de referencia OpenDesign Arena, ejecutó 13 modelos de IA a través del mismo lote de tareas de diseño esta semana. El que obtuvo la puntuación más alta fue GPT-6 Astra de OpenAI. Pero el modelo más nuevo de DeepSeek, V4.1 Flash, alcanzó el 98% de esa puntuación máxima mientras cobraba aproximadamente el 1.4% del precio máximo.

OpenDesign Arena califica modelos en trabajo de diseño cotidiano—construir aplicaciones web, paneles de control, pantallas móviles y páginas de destino—sobre 100 puntos. Treinta de esos puntos verifican si la salida realmente cumple con el brief; los otros 70 califican la calidad del diseño en cuanto a diseño, jerarquía, color y ajuste de estilo.

Myriad: ¿Qué tan alto cotizará Nvidia en septiembre? Haz clic para hacer tu predicción.
Myriad: ¿Qué tan alto cotizará Nvidia en septiembre? Haz clic para hacer tu predicción.

Está diseñado para responder una pregunta más concreta que la que plantean la mayoría de las clasificaciones de IA: qué modelo debería usar realmente mañana un diseñador web en activo.

En esa escala, GPT-6 Astra promedió 82,7 puntos, tardando 11,1 minutos y 1,61 dólares por diseño terminado. DeepSeek V4.1 Flash obtuvo 81,2, terminó el trabajo en 5,3 minutos y costó 0,023 dólares. Claude Fable 5.1 alcanzó 80,3, tardó 12,8 minutos y costó 3,66 dólares.

Todos los demás modelos que OpenDesign probó—Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash y Gemini 3.8 Flash entre ellos—obtuvieron una puntuación inferior a DeepSeek V4.1 Flash y costaron más de ejecutar. Eso es 11 de los 13 modelos probados. Solo GPT-6 Astra lo superó de manera absoluta, y solo por un punto y medio.

El informe técnico de DeepSeek para V4.1 Flash explica de dónde vienen los ahorros. El modelo tiene 552 mil millones de parámetros en total—la configuración interna que un modelo ajusta durante el entrenamiento para almacenar lo que ha aprendido—pero solo activa 8 mil millones de ellos para leer un mensaje entrante y 16 mil millones para escribir la respuesta. DeepSeek llama a esto un diseño Causal Encoder-Decoder, y es el mismo truco detrás de los rápidos tiempos de finalización del modelo.

Esta no es la primera incursión de DeepSeek en cerrar una brecha de capacidad a bajo costo. Semanas antes, el modelo V4 Pro de la compañía quedó dentro del 5% de Claude Fable 5 en una comparación de referencia separada mientras cobraba una fracción de la tarifa de Fable. DeepSeek también ha estado reclutando ingenieros en Pekín para construir su propio Code Harness, con el objetivo de poseer todo el stack agéntico en lugar de solo proporcionar el modelo subyacente.

La configuración de pruebas de OpenDesign limita lo que estos números pueden demostrar. La salida de un modelo solo se puntúa si se renderiza como una página web funcional en primer lugar; cualquier cosa en blanco, rota o cortada obtiene cero y no se vuelve a probar. Eso significa que el benchmark mide la producción de diseño confiable y cotidiana, no el razonamiento general ni la habilidad de programación.

GPT-6 Astra, que OpenAI lanzó el 3 de septiembre, ya tiene una reputación de hacer un poco de todo—disponer una placa de circuito, redactar una declaración de impuestos, construir una escena 3D—pero los primeros probadores lo señalaron como un escritor más débil que el modelo al que reemplazó. Su precio y ritmo en el gráfico de OpenDesign encajan con ese mismo diseño generalista: más lento y más caro que la entrada más barata de DeepSeek, pero aún así el de mayor puntuación en el campo.

La tasa de entrega de DeepSeek V4.1 Flash —la proporción de resultados que OpenDesign consideró listos para entregar sin revisión— fue del 57,7%. La tasa de entrega de GPT-6 Astra fue del 60%. La de Claude Fable 5.1 fue del 56,7%.