En resumen
- Qwen-Image-3.0, lanzado el 21 de julio por el equipo Qwen de Alibaba, acepta 4.500 tokens de instrucciones.
- Esto permite la generación en una sola pasada de diseños complejos como periódicos, guiones gráficos y cuadrículas densas de infografías.
- A diferencia de su predecesor, el lanzamiento no incluyó pesos de modelo abiertos, puntos de referencia ni un informe técnico; está disponible en chat.qwen.ai con precios de API aún no revelados.
El equipo Qwen de Alibaba lanzó Qwen Image 3.0 el martes, y la propuesta no tiene nada que ver con lo hermoso que se ve el resultado. Se trata de si el resultado puede usarse realmente en el trabajo.
La mayoría de las herramientas de imagen con IA (Reve, Nano Banana, Seedream) están diseñadas para sobresalir en áreas específicas: creatividad, realismo, capacidades de edición, etc. Qwen Image 3.0 va en una dirección diferente. "Qwen-Image-3.0 no solo persigue lo 'bonito', sino que persigue lo 'útil', haciendo que la generación de imágenes sea una herramienta de productividad realmente desplegable", escribió el equipo Qwen en el anuncio oficial.
La pieza central es lo que el gigante chino Alibaba llama contenido rico. El modelo acepta hasta 4.500 tokens, que es 4,5 veces más de lo que la generación anterior podía procesar. Los tokens son las unidades de texto que una IA lee; imagina un token como aproximadamente una palabra o parte de una palabra, así que 4.500 de ellos son varias páginas de instrucciones detalladas.
Eso es suficiente para describir nueve paneles de infografía separados en una sola indicación y obtenerlos como una imagen completa.

"Toda la imagen anterior fue generada por Qwen-Image-3.0 en una sola pasada, en lugar de ser ensamblada a partir de múltiples imágenes," escribió Alibaba en su blog. Cada panel en la demostración contiene sus propios diagramas, fórmulas, leyendas y texto en letra pequeña, renderizados de una sola vez, no ensamblados después.
Este es el único modelo capaz de lograr esto sin errores importantes.
La segunda parte es lo que la compañía llama detalles auténticos. Según Alibaba, el modelo "admite la representación precisa de texto tan pequeño como 10px, reproduciendo vívidamente detalles como poros y hebras de cabello con una representación realista a nivel micro." Diez píxeles es letra pequeña, el tipo que se ve en los descargos farmacéuticos. El modelo también maneja LaTeX, el sistema de notación que los investigadores usan para escribir ecuaciones matemáticas complejas, con precisión en maquetas completas de artículos académicos.
En nuestras pruebas habituales les damos a los modelos algunas frases y evaluamos cómo las procesan. Qwen Image 3.0 fue capaz de generar la imagen a continuación, según el blog oficial de Alibaba.

Probamos esta función utilizando la configuración más rápida del modelo. Qwen Image 3.0 fue capaz de reproducir un artículo completo de Decrypt. La ejecución fue realmente impresionante, pero el resultado no fue impecable.

El tercer pilar de Qwen Image 3.0 es el conocimiento profundo. Según el equipo de Qwen, el modelo "admite renderizado nativo de 12 idiomas, simula interfaces principales como páginas web, juegos y transmisiones en vivo, y se basa en un rico conocimiento del mundo". También se conecta a internet para obtener datos en vivo, lo que significa que al solicitar un pronóstico del tiempo para una ciudad y fecha específicas, se obtiene un gráfico preciso, no una suposición.
Por ejemplo, Alibaba compartió una foto de un insecto sobre una hoja. El modelo fue capaz de generar texto relevante basado en su comprensión de la imagen.

Alibaba está promocionando sus servicios a estudios de diseño, equipos de contenido, operaciones de comercio electrónico y educadores que necesitan activos visuales listos para producción en grandes cantidades.
Sin embargo, cabe señalar que en la propia evaluación Qwen-Image-Bench de Alibaba —un punto de referencia que puntúa la calidad de imagen, la estética y la fidelidad al mundo real en 18 modelos— Qwen Image 2.0 Pro, el buque insignia anterior, ocupó el quinto lugar. El GPT Image 2 de OpenAI lideró la clasificación. El nuevo modelo puede rendir mejor, pero el lanzamiento no ofrece una forma medida de confirmarlo, porque llegó sin tabla de referencia, pesos descargables ni informe técnico.
Qwen Image 1.0 se lanzó con pesos abiertos bajo una licencia Apache 2.0 y un informe técnico el mismo día. Este no. Como parte de la reciente apuesta de Alibaba por la IA, la evidencia aquí son enteramente las imágenes de ejemplo seleccionadas que la compañía decidió publicar. Las pruebas de API están abiertas en chat.qwen.ai. El precio aún no se ha anunciado.






