En bref
- Qwen-Image-3.0, publié le 21 juillet par l'équipe Qwen d'Alibaba, accepte 4 500 jetons d'instructions.
- Cela permet la génération en une seule passe de mises en page complexes comme des journaux, des storyboards et des grilles d'infographies denses.
- Contrairement à son prédécesseur, la version est sortie sans poids de modèle ouverts, sans benchmarks ni rapport technique ; elle est disponible sur chat.qwen.ai avec des prix d'API non encore divulgués.
L'équipe Qwen d'Alibaba a lancé Qwen Image 3.0 mardi, et l'argument n'a rien à voir avec la beauté du résultat. Il s'agit de savoir si le résultat peut réellement être utilisé au travail.
La plupart des outils d'image IA—Reve, Nano Banana, Seedream—sont conçus pour exceller dans des domaines spécifiques : créativité, réalisme, capacités d'édition, etc. Qwen Image 3.0 va dans une direction différente. « Qwen-Image-3.0 ne cherche pas seulement à être "beau"—il cherche à être "utile", faisant de la génération d'images un outil de productivité réellement déployable », a écrit l'équipe Qwen dans l'annonce officielle.
La pièce maîtresse est ce que le géant chinois Alibaba appelle le contenu riche. Le modèle accepte jusqu'à 4 500 jetons, soit 4,5 fois plus que ce que la génération précédente pouvait traiter. Les jetons sont les unités de texte qu'une IA lit ; imaginez un jeton comme environ un mot ou une partie d'un mot, donc 4 500 d'entre eux représentent plusieurs pages d'instructions détaillées.
C'est suffisant pour décrire neuf panneaux d'infographie distincts dans une seule invite et les obtenir sous forme d'une image complète.

« L'image entière ci-dessus a été générée par Qwen-Image-3.0 en une seule passe, plutôt que d'être assemblée à partir de plusieurs images », a écrit Alibaba dans son blog. Chaque panneau de la démo contient ses propres diagrammes, formules, légendes et textes en petits caractères — rendus en une seule prise, non assemblés en post-production.
C'est le seul modèle capable d'y parvenir sans erreurs majeures.
La deuxième partie est ce que l'entreprise appelle des détails authentiques. Selon Alibaba, le modèle « prend en charge le rendu précis de textes aussi petits que 10 px, reproduisant de manière vivante des détails comme les pores et les brins de cheveux avec une représentation réaliste au niveau microscopique ». Dix pixels, c'est du texte fin — le genre que l'on voit sur les avertissements pharmaceutiques. Le modèle gère également LaTeX — le système de notation que les chercheurs utilisent pour écrire des équations mathématiques complexes — avec précision sur des maquettes complètes d'articles académiques.
Dans nos tests habituels, nous donnons aux modèles quelques phrases et évaluons comment ils les traitent. Qwen Image 3.0 a été capable de générer l'image ci-dessous, selon le blog officiel d'Alibaba.

Nous avons essayé cette fonctionnalité en utilisant la configuration la plus rapide du modèle. Qwen Image 3.0 a pu reproduire un article complet de Decrypt. L'exécution était vraiment impressionnante, mais le résultat n'était pas parfait.

Le troisième pilier de Qwen Image 3.0 est la connaissance approfondie. Selon l'équipe Qwen, le modèle « prend en charge le rendu natif de 12 langues, simule des interfaces grand public telles que les pages web, les jeux et les diffusions en direct, et s'appuie sur une riche connaissance du monde ». Il se connecte également à Internet pour récupérer des données en direct, ce qui signifie qu'une demande de visuel de prévisions météorologiques pour une ville et une date spécifiques renvoie un graphique précis, et non une supposition.
Par exemple, Alibaba a partagé une photo d'un insecte sur une feuille. Le modèle a pu générer un texte pertinent en se basant sur sa compréhension de l'image.

Alibaba cible les studios de design, les équipes de contenu, les opérations de commerce électronique et les éducateurs qui ont besoin d'actifs visuels prêts à l'emploi en volume.
Il convient toutefois de noter que dans l'évaluation Qwen-Image-Bench d'Alibaba elle-même—un benchmark qui évalue la qualité d'image, l'esthétique et la fidélité au monde réel sur 18 modèles—Qwen Image 2.0 Pro, le précédent fleuron, s'est classé cinquième. Le GPT Image 2 d'OpenAI a mené le classement. Le nouveau modèle pourrait être plus performant, mais le lancement n'offre aucun moyen mesuré de le confirmer, car il est arrivé sans tableau de référence, sans poids téléchargeables ni rapport technique.
Qwen Image 1.0 a été lancé avec des poids ouverts sous licence Apache 2.0 et un rapport technique publié le même jour. Ce n'est pas le cas pour celui-ci. Dans le cadre de la récente poussée de l'IA d'Alibaba, les preuves ici sont entièrement constituées des exemples d'images soigneusement sélectionnés que l'entreprise a choisi de publier. Les essais API sont ouverts sur chat.qwen.ai. Le prix n'a pas encore été annoncé.






