PUBLICIDADE

Alibaba Encolhe Sua IA de Imagens: Qwen-Image-2.1 Une Geração e Edição em um Modelo de Apenas 7 Bilhões de Parâmetros

21/09/2026
9 visualizações
4 min de leitura
Imagem principal do post

Alibaba Qwen Lança Qwen-Image-2.1: Modelo Unificado de Geração e Edição de Imagens com 7 Bilhões de Parâmetros

A equipe Qwen, da Alibaba, apresentou o Qwen-Image-2.1, um modelo unificado que combina geração de imagens a partir de texto e edição de imagens em uma única arquitetura. O componente visual do modelo conta com 7 bilhões de parâmetros distribuídos em 32 camadas DiT de fluxo único, um tipo de arquitetura baseada em transformer (modelo de aprendizado profundo que processa dados em sequência) usada para gerar imagens a partir de ruído. Segundo a empresa, um único checkpoint — arquivo que armazena os pesos treinados de um modelo — abrange tarefas como geração de texto para imagem, edição com múltiplas referências, edições locais e saída em formato transparente RGBA, que inclui os canais vermelho, verde, azul e alfa de transparência.

Imagem complementar

A nova versão representa uma redução expressiva de tamanho em relação ao modelo original. O Qwen-Image original, lançado em agosto de 2025, possuía 20 bilhões de parâmetros e operava sob a licença Apache 2.0, enquanto a função de edição ficava em um checkpoint separado chamado Qwen-Image-Edit. Com o Qwen-Image-2.1, ambas as funcionalidades foram fundidas em um único modelo com aproximadamente um terço do tamanho original. A equipe Qwen descreve a versão 2.1 como a mais equilibrada e com melhor relação custo-benefício da série Qwen-Image. É importante destacar que o valor de 7 bilhões se refere apenas ao transformer de difusão, pois o pipeline também carrega um codificador Qwen3-VL de 8 bilhões de parâmetros.

PUBLICIDADE

A arquitetura do modelo, conforme listado no repositório no GitHub, é composta por quatro elementos principais. O transformer utiliza 32 camadas com 7 bilhões de parâmetros em um design de fluxo único com atenção block-causal, mecanismo que combina máscaras causais (que processam dados em ordem) e bidirecionais dependendo do tipo de dado. O codificador de texto é o Qwen3-VL de 8 bilhões, responsável por transformar instruções textuais e imagens de condição em uma representação unificada. O VAE (autoencoder variational) opera com 64 canais RGBA, compressão espacial de 16 vezes e suporte nativo a transparência. Por fim, o agendador utiliza fluxo de correspondência com agendamento discreto de Euler e deslocamento dinâmico.

O ganho de velocidade vem da estratégia de máscara de atenção. Os tokens de texto (unidades mínimas de informação processadas pelo modelo) usam uma máscara causal em nível de token, enquanto os tokens de imagem adotam uma máscara bidirecional em nível de bloco dentro de cada imagem. A Qwen chama essa abordagem de atenção de granularidade mista. Como o prefixo de condição é posicionado antes do espaço latente ruidoso e nunca depende dele, suas chaves e valores permanecem fixos durante todas as etapas de denoising (processo de remover ruído gradativamente para formar a imagem final). O modelo calcula textos e imagens de entrada uma única vez no primeiro passo e reutiliza esse cache de prefixo nas etapas seguintes, o que gera economia crescente conforme aumenta o número de imagens de referência.

Entre os recursos disponíveis, o Qwen-Image-2.1 oferece suporte nativo a transparência com geração de imagens RGBA a partir de texto, edição de camadas transparentes e extração de sujeitos de fotos. A edição com múltiplas referências aceita até 10 imagens de referência. O controle local permite delimitar regiões por meio de círculos, anotações pintadas ou máscaras separadas, preservando a identidade de pessoas e produtos. O modelo opera nativamente em resolução 2K, com padrão de 2048 por 2048 pixels e sete proporções de tela suportadas, chegando a 2752 por 1536 pixels. A equipe também destaca melhorias em tipografia, iluminação de retratos e detalhes finos.

No benchmark interno Qwen-Image-Bench, o Qwen-Image-2.1 obteve pontuação geral de 60,28, posicionando-se acima do Nano Banana 2.0, que marcou 59,82, e de todos os modelos de pesos abertos listados. O FLUX 2 Max, um modelo aberto de 32 bilhões, ficou em 55,33. Seis modelos fechados pontuaram acima, liderados pelo GPT Image 2.5 Sunburst com 67,01.

O modelo pode ser executado em ferramentas como Diffusers, ComfyUI, vLLM-Omni, SGLang e LightX2V, com suporte no primeiro dia para diversas plataformas. Além de GPUs da NVIDIA, o lançamento contempla GPUs AMD Radeon via ROCm e oito plataformas de chip via FlagOS. A Qwen também disponibilizou dois modelos de reescrita de prompts baseados em Qwen3.5-VL 9B, capazes de expandir descrições curtas em instruções detalhadas e selecionar a proporção de tela adequada. Para uso comercial, é necessário obter uma licença separada junto à Qwen, já que a licença de pesquisa padrão impede esse tipo de aplicação sem autorização.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!