Em resumo

  • Qwen-Image-3.0, lançado em 21 de julho pela equipe Qwen da Alibaba, aceita 4.500 tokens de instruções.
  • Isso permite a geração em uma única passagem de layouts complexos como jornais, storyboards e grades densas de infográficos.
  • Ao contrário de seu antecessor, o lançamento não incluiu pesos de modelo abertos, benchmarks ou relatório técnico; está disponível em chat.qwen.ai com preços de API ainda não divulgados.

A equipe Qwen da Alibaba lançou o Qwen Image 3.0 na terça-feira, e a proposta não tem nada a ver com a beleza da saída. Trata-se de saber se a saída pode realmente ser usada no trabalho.

A maioria das ferramentas de imagem por IA—Reve, Nano Banana, Seedream—são projetadas para se destacar em áreas específicas: criatividade, realismo, capacidades de edição, e assim por diante. O Qwen Image 3.0 está seguindo uma direção diferente. "Qwen-Image-3.0 não está apenas buscando 'bonito'—está buscando 'útil', tornando a geração de imagens uma ferramenta de produtividade verdadeiramente implantável," escreveu a equipe Qwen no anúncio oficial.

A peça central é o que a gigante chinesa Alibaba chama de conteúdo rico. O modelo aceita até 4.500 tokens, o que é 4,5 vezes mais do que a geração anterior podia processar. Tokens são as unidades de texto que uma IA lê; imagine um token como aproximadamente uma palavra ou parte de uma palavra, então 4.500 deles são várias páginas de instruções detalhadas.

Isso é suficiente para descrever nove painéis de infográfico separados em um único prompt e obtê-los de volta como uma imagem completa.