O modelo Jev agora está integrado e disponível · Boas-vindas
Blogue
Guia

Análise do Qwen-Image-2.1

RGBA nativo e edição com várias referências são diferenciais reais, mas a licença apenas para pesquisa e o piso prático de cerca de 28-34 GB tornam o modelo uma opção de avaliação, não um padrão comercial.

14 min de leituraOmniaKey
Qwen-Image-2.1geração de imagensedição de imagensComfyUIVRAM

Esta análise do Qwen-Image-2.1 encontra um modelo de pesos abertos interessante por duas capacidades raras: saída RGBA nativa e um único pipeline para gerar e editar. Também encontra dois limites decisivos: os pesos públicos usam uma licença de pesquisa não comercial, e os arquivos principais somam cerca de 33.1 GB antes da sobrecarga de inferência.

Vale avaliar para assets transparentes, adesivos, recorte de objetos e composições com várias referências. Ainda não é a escolha mais simples para um produto comercial de imagens nem para uma GPU de 24 GB sem otimização.

Verificado em 21 de setembro de 2026. Consultamos o lançamento, repositório, arquivos do Hugging Face, licença, instruções de Diffusers/ComfyUI, receita do vLLM-Omni, gráfico oficial da Qwen e o GenAI Image Showdown independente. Também baixamos quatro amostras oficiais. A geração própria no Demo público não terminou porque o Space estava ocupado; portanto, esta é uma análise de lançamento baseada em evidências, não um benchmark próprio. A galeria oficial contém exemplos selecionados pelo fornecedor.

Qwen-Image-2.1: resumo da análise

PerguntaResposta verificada
O que éModelo unificado de texto para imagem e edição, ID Qwen/Qwen-Image-2.1
ArquiteturaGerador visual 7B, 32 camadas Single-Stream DiT, codificador Qwen3-VL 8B
Resolução2K nativo; Diffusers usa 2048x2048 por padrão
TransparênciaGeração e edição RGBA nativa de quatro canais
ReferênciasAté 10 no pipeline oficial; 4 no vLLM-Omni atual
Amostragem40 etapas no exemplo oficial do Diffusers
Tamanho localCerca de 33.1 GB para codificador, Transformer e VAE, sem overhead
LicençaQwen Research License, apenas pesquisa/avaliação não comercial
OmniaKeyNão consta no catálogo em 2026-09-21

O melhor motivo para testar não é uma colocação em ranking, mas a combinação de alfa real, dez referências e edição local. Licença, memória e pouca avaliação independente são motivos concretos para não implantar sem cautela.

O que é o Qwen-Image-2.1?

A Qwen lançou o Qwen-Image-2.1 em 20 de setembro de 2026. Texto para imagem, edição de uma imagem, composição multirreferência, máscaras, marcações pintadas e recorte transparente usam o mesmo pipeline.

O rótulo 7B descreve apenas o gerador visual, não tudo que é carregado:

  • gerador visual de 7B parâmetros e 32 camadas Single-Stream DiT;
  • codificador Qwen3-VL 8B para prompts e imagens de referência;
  • VAE de 64 canais latentes, compressão espacial 16x e quatro canais de entrada/saída;
  • RGB, RGBA, geração e edição em um só modelo.

Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang e LightX2V anunciaram suporte no lançamento. Os limites variam por runtime: Diffusers documenta dez referências, mas o vLLM-Omni atual rejeita a quinta imagem.

O que as amostras oficiais mostram

Inspecionamos os arquivos originais. O pôster reproduziu corretamente as duas linhas em inglês solicitadas, com hierarquia e espaçamento coerentes. O storyboard teve exatamente seis quadros e manteve um pequeno robô reconhecível. A imagem de produto mostrou refração e reflexos convincentes no vidro.

A amostra transparente é um PNG RGBA de 1664x2496, com alfa entre 0 e 255. Há pixels realmente transparentes e opacos, não um padrão quadriculado pintado em RGB. Essa é a capacidade mais claramente diferenciada do lançamento.

São exemplos selecionados pela Qwen, não um teste cego. Por causa da licença de pesquisa, não republicamos os arquivos e apontamos para a galeria oficial, descrevendo apenas propriedades verificáveis.

Benchmarks do Qwen-Image-2.1

O gráfico da Qwen publica 60.28 para o modelo no Qwen-Image-Bench. É uma evidência útil do fornecedor, não um ranking independente, pois benchmark, agregação e avaliação vêm do criador do modelo.

O GenAI Image Showdown independente usa 15 tarefas difíceis de aderência ao prompt, permite ajustar o prompt para cada modelo e proíbe edição e inpainting.

ModeloTarefas aprovadasCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
Qwen-Image original4 / 1568%

O 2.1 sobe de 4 para 7 aprovações, enquanto a métrica separada de compliance passa de 68% para 67%. Não há contradição: as duas medidas avaliam coisas diferentes. Nesse teste pequeno, o 2.1 melhora sobre o original, mas não lidera em instruções complexas.

Os 60.28 oficiais e os 7 / 15 independentes não devem ser unidos em um ranking porque tarefas e pontuação são diferentes.

2K nativo, RGBA e edição

O Diffusers usa 2048x2048 e 40 etapas por padrão. A Qwen recomenda, entre outros, 2400x1792 para 4:3, 1792x2400 para 3:4, 2752x1536 para 16:9 e 1536x2752 para 9:16.

“2K nativo” descreve a tela pretendida; não garante texto pequeno perfeito, contagem exata de objetos ou mais detalhe semântico. Resolução e aderência ao prompt são testes separados.

A edição aceita até dez referências no Diffusers, preservação de identidade de pessoas e produtos, círculos ou pintura para alterações locais, máscaras separadas, extração de objetos e camadas transparentes. Para RGBA, a Qwen recomenda pedir explicitamente canal alfa e fundo transparente e salvar em PNG. JPEG não preserva alfa.

Requisitos de VRAM

ComponenteTamanho serializado aproximado
Codificador Qwen3-VL17.5 GB
Transformer DiT14.2 GB
VAE RGBA1.4 GB
Total33.1 GB

Tamanho em disco não é pico de VRAM, mas o caminho BF16 oficial com .to("cuda") não é uma configuração confortável de 24 GB. O vLLM-Omni mediu em uma NVIDIA GB300, 1024x1024 e 40 etapas:

ConfiguraçãoPico de memóriaTempo por imagem
BF1634.0 GB3.28-4.49 s
DiT FP8, img_mlp sensível em BF1632.0-32.7 GB3.36-4.71 s
Codificador de texto FP827.5-28.1 GB3.43-4.77 s

São números de GB300 a 1024px, não de RTX 3090/4090 nem do 2K padrão. FP8 economizou memória, mas não acelerou esse teste. Uma placa de 24 GB pode funcionar com quantização, offload para CPU, VAE em tiles ou workflow comunitário do ComfyUI, porém isso é um projeto de otimização, não uma base garantida.

Instalação local com Diffusers

O quick start instala o Diffusers do Git. Para testes reproduzíveis, use ambiente virtual e fixe o commit validado.

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

Para várias referências, passe image=[...]. Registre seed, prompt completo, commit do runtime, precisão, resolução e etapas; sem isso, comparações de qualidade não são reproduzíveis.

ComfyUI e serving

O ComfyUI tem suporte nativo e workflows JSON oficiais de geração e edição. É um ponto inicial fácil para experimentos visuais e offload da comunidade. Diffusers é mais claro para avaliação Python controlada; vLLM-Omni e SGLang visam serving, lotes, cache e FP8. Envie 40 etapas explicitamente e confira o limite de referências do runtime.

Licença e uso comercial

A licença publicada não concede uso comercial. A Qwen Research License define Non-Commercial como pesquisa ou avaliação e limita a esse contexto o uso, modificação e distribuição dos materiais.

UsoPosição da licença publicada
Pesquisa/avaliação internaPermitida sob as condições do acordo
Redistribuição de pesos ou derivadosSujeita ao limite não comercial e avisos
Produto pago ou serviço comercialExige licença comercial separada
Contatomodel-business@notice.qwencloud.com

Pesos disponíveis para download não significam Apache-2.0 nem código aberto comercial. Para vender imagens geradas ou colocar o modelo em um serviço pago, obtenha termos por escrito e orientação jurídica em vez de deduzir direitos da palavra “open-source” no anúncio.

Para quem faz sentido

Avalie se a transparência nativa elimina uma etapa de recorte, se precisa de várias pessoas/produtos de referência, quer geração e edição locais em um modelo, dispõe de mais de 32 GB ou aceita quantização/offload e o uso é realmente pesquisa não comercial.

Espere se ainda não tem licença comercial, precisa de 2K pronto em 24 GB, prioriza aderência exata ao prompt, exige dados maduros de tipografia multilíngue ou precisa hoje de uma API Qwen-Image-2.1 gerenciada pela OmniaKey.

Para uma API de imagem já disponível, veja a análise Nano Banana 2 vs Pro. O catálogo de modelos é a fonte correta de disponibilidade da OmniaKey.

Limites desta análise

Não concluímos uma geração nova porque o Demo estava ocupado. As observações visuais vêm de quatro exemplos oficiais selecionados. O comparativo independente tem apenas 15 tarefas de texto para imagem e não mede edição ou transparência. Os dados de hardware são de GB200/GB300, não de RTX de consumo. Este texto é análise técnica, não aconselhamento jurídico.

Perguntas frequentes

O Qwen-Image-2.1 é open source?

Código e pesos podem ser baixados publicamente e a Qwen usa o termo open-source. Porém, os pesos têm licença de pesquisa que restringe uso comercial. “Pesos abertos sob licença de pesquisa” é mais preciso do que código aberto sem restrições.

Quanta VRAM o Qwen-Image-2.1 precisa?

Os arquivos principais somam cerca de 33.1 GB. O vLLM-Omni mediu 34.0 GB em BF16 e 27.5-28.1 GB com o codificador de texto FP8 em GB300. Resolução, precisão, offload, runtime e GPU alteram o resultado.

Roda em RTX 3090 ou 4090?

Não pelo caminho BF16 completo .to("cuda") do exemplo oficial. Quantização e offload podem viabilizar 24 GB, mas os dados oficiais não demonstram velocidade ou estabilidade 2K nessas placas.

O Qwen-Image-2.1 funciona no ComfyUI?

Sim. O ComfyUI publicou suporte nativo e workflows oficiais de texto para imagem e edição no dia do lançamento.

Quantas imagens de referência ele aceita?

O Diffusers oficial aceita até 10; o vLLM-Omni atual aceita 4. Confirme o runtime usado na implantação.

Pode ser usado comercialmente?

A Qwen Research License pública não concede esse uso. Solicite licença separada em model-business@notice.qwencloud.com e revise juridicamente o caso.

O Qwen-Image-2.1 está disponível na OmniaKey?

Não em 21 de setembro de 2026. O catálogo contém rotas Qwen Image 3, mas não Qwen/Qwen-Image-2.1. Esta análise não anuncia disponibilidade.

Fontes primárias

Evidências verificadas em 2026-09-21. Runtime, limites e opções de licença podem mudar; reabra as fontes primárias antes de decidir uma implantação.