En bref

  • Qwen-Image-3.0, publié le 21 juillet par l'équipe Qwen d'Alibaba, accepte 4 500 jetons d'instructions.
  • Cela permet la génération en une seule passe de mises en page complexes comme des journaux, des storyboards et des grilles d'infographies denses.
  • Contrairement à son prédécesseur, la version est sortie sans poids de modèle ouverts, sans benchmarks ni rapport technique ; elle est disponible sur chat.qwen.ai avec des prix d'API non encore divulgués.

L'équipe Qwen d'Alibaba a lancé Qwen Image 3.0 mardi, et l'argument n'a rien à voir avec la beauté du résultat. Il s'agit de savoir si le résultat peut réellement être utilisé au travail.

La plupart des outils d'image IA—Reve, Nano Banana, Seedream—sont conçus pour exceller dans des domaines spécifiques : créativité, réalisme, capacités d'édition, etc. Qwen Image 3.0 va dans une direction différente. « Qwen-Image-3.0 ne cherche pas seulement à être "beau"—il cherche à être "utile", faisant de la génération d'images un outil de productivité réellement déployable », a écrit l'équipe Qwen dans l'annonce officielle.

La pièce maîtresse est ce que le géant chinois Alibaba appelle le contenu riche. Le modèle accepte jusqu'à 4 500 jetons, soit 4,5 fois plus que ce que la génération précédente pouvait traiter. Les jetons sont les unités de texte qu'une IA lit ; imaginez un jeton comme environ un mot ou une partie d'un mot, donc 4 500 d'entre eux représentent plusieurs pages d'instructions détaillées.

C'est suffisant pour décrire neuf panneaux d'infographie distincts dans une seule invite et les obtenir sous forme d'une image complète.