Recensione di Qwen-Image-2.1
RGBA nativo ed editing multi-riferimento sono punti di forza concreti, ma la licenza per sola ricerca e un minimo pratico di circa 28-34 GB rendono il modello più adatto alla valutazione che a un impiego commerciale predefinito.
Questa Qwen-Image-2.1 recensione descrive un modello di immagini open-weight interessante per due capacità rare: output RGBA nativo e una sola pipeline per generazione e modifica. Evidenzia anche due limiti decisivi: i pesi pubblici hanno una licenza di ricerca non commerciale e i file principali occupano circa 33.1 GB prima dell'overhead di inferenza.
Vale la pena valutarlo per asset trasparenti, sticker, estrazione di soggetti e composizioni multi-riferimento. Non è ancora la scelta più semplice per un prodotto commerciale o per una GPU da 24 GB senza ottimizzazioni.
Verificato il 21 settembre 2026. Abbiamo controllato annuncio, repository, file Hugging Face, licenza, guide Diffusers/ComfyUI, ricetta vLLM-Omni, grafico Qwen e GenAI Image Showdown indipendente. Abbiamo anche scaricato quattro output ufficiali. Una generazione personalizzata sul Demo pubblico non è terminata perché lo Space era occupato: questa è quindi una recensione di lancio basata sulle prove, non un benchmark proprietario. La galleria ufficiale contiene esempi selezionati dal fornitore.
Qwen-Image-2.1 recensione: risposta breve
| Domanda | Risposta verificata |
|---|---|
| Cos'è | Modello unificato text-to-image e editing, ID Qwen/Qwen-Image-2.1 |
| Architettura | Generatore visivo 7B, 32 layer Single-Stream DiT, encoder Qwen3-VL 8B |
| Risoluzione | 2K nativo; Diffusers usa 2048x2048 per impostazione predefinita |
| Trasparenza | Generazione e modifica RGBA nativa a quattro canali |
| Immagini di riferimento | Fino a 10 nella pipeline ufficiale; 4 nell'attuale vLLM-Omni |
| Campionamento | 40 step nell'esempio Diffusers ufficiale |
| Ingombro locale | Circa 33.1 GB per encoder, Transformer e VAE, prima dell'overhead |
| Licenza | Qwen Research License, sola ricerca/valutazione non commerciale |
| OmniaKey | Non presente in catalogo al 2026-09-21 |
Il motivo migliore per provarlo non è la classifica, ma l'unione di alfa reale, dieci riferimenti ed editing locale. Licenza, memoria e poche valutazioni indipendenti sconsigliano invece un impiego immediato in produzione.
Cos'è Qwen-Image-2.1?
Qwen ha pubblicato Qwen-Image-2.1 il 20 settembre 2026. Generazione text-to-image, modifica di un'immagine, composizione multi-riferimento, maschere, indicazioni dipinte ed estrazione trasparente passano dalla stessa pipeline.
L'etichetta 7B indica soltanto il generatore visivo, non tutto lo stack caricato:
- generatore visivo 7B con 32 layer Single-Stream DiT;
- encoder Qwen3-VL 8B per prompt e immagini di riferimento;
- VAE con 64 canali latenti, compressione spaziale 16x e quattro canali in ingresso/uscita;
- RGB, RGBA, generazione e modifica in un modello.
Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang e LightX2V hanno annunciato supporto day-one. I limiti dipendono dal runtime: Diffusers documenta dieci riferimenti, mentre l'attuale vLLM-Omni rifiuta la quinta immagine.
Cosa mostrano gli esempi ufficiali
Abbiamo ispezionato i file originali. Il poster ha riprodotto correttamente entrambe le righe inglesi richieste, con gerarchia e spaziatura coerenti. Lo storyboard ha prodotto esattamente sei riquadri mantenendo riconoscibile il piccolo robot. L'immagine di prodotto mostra rifrazione e riflessi del vetro convincenti.
L'esempio trasparente è un PNG RGBA da 1664x2496 con alfa tra 0 e 255. Contiene pixel realmente trasparenti e opachi, non una scacchiera disegnata in RGB. È la capacità più chiaramente distintiva della release.
Sono esempi ufficiali selezionati, non un test cieco. Data la licenza di ricerca, non li ripubblichiamo: rimandiamo alla galleria e riportiamo proprietà verificabili.
Benchmark di Qwen-Image-2.1
Il grafico Qwen riporta 60.28 su Qwen-Image-Bench. È un dato utile del produttore, non una classifica indipendente, perché benchmark, aggregazione e valutazione provengono dall'editore del modello.
Il GenAI Image Showdown indipendente usa 15 compiti difficili di aderenza al prompt, consente di adattare il prompt per modello e vieta editing e inpainting.
| Modello | Compiti superati | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| Qwen-Image originale | 4 / 15 | 68% |
2.1 passa da 4 a 7 compiti superati, mentre la metrica separata compliance cambia dal 68% al 67%. Non è una contraddizione: misurano aspetti diversi. In questo test ridotto 2.1 migliora sull'originale, ma non guida nell'aderenza a istruzioni complesse.
Il 60.28 ufficiale e il 7 / 15 indipendente non si possono fondere in una classifica, perché usano compiti e punteggi diversi.
2K nativo, RGBA e modifica immagini
Diffusers usa 2048x2048 e 40 step per impostazione predefinita. Qwen raccomanda anche 2400x1792 per 4:3, 1792x2400 per 3:4, 2752x1536 per 16:9 e 1536x2752 per 9:16.
“2K nativo” indica la tela prevista; non garantisce testo piccolo perfetto, conteggi esatti o più dettaglio semantico. Risoluzione e fedeltà al prompt sono test separati.
L'editing supporta fino a dieci riferimenti in Diffusers, preservazione dell'identità di persone/prodotti, cerchi o pittura per modifiche locali, maschere separate, estrazione del soggetto e livelli trasparenti. Per RGBA, Qwen suggerisce di richiedere esplicitamente canale alfa e sfondo trasparente, salvando in PNG. JPEG non conserva l'alfa.
Requisiti VRAM di Qwen-Image-2.1
| Componente | Dimensione serializzata approssimativa |
|---|---|
| Encoder testo/visione Qwen3-VL | 17.5 GB |
| Transformer DiT | 14.2 GB |
| VAE RGBA | 1.4 GB |
| Totale | 33.1 GB |
La dimensione su disco non coincide con il picco VRAM, ma il percorso BF16 ufficiale .to("cuda") non è una configurazione comoda da 24 GB. vLLM-Omni ha misurato su una NVIDIA GB300, 1024x1024 e 40 step:
| Configurazione | Picco memoria | Tempo per immagine |
|---|---|---|
| BF16 | 34.0 GB | 3.28-4.49 s |
DiT FP8, img_mlp sensibile in BF16 | 32.0-32.7 GB | 3.36-4.71 s |
| Encoder testo FP8 | 27.5-28.1 GB | 3.43-4.77 s |
Sono misure GB300 a 1024px, non RTX 3090/4090 né 2K predefinito. FP8 ha soprattutto ridotto la memoria e non ha accelerato il test. Una scheda da 24 GB può funzionare con quantizzazione, CPU offload, VAE tiling o workflow ComfyUI della community, ma va considerato un progetto di ottimizzazione e non una base garantita.
Installazione locale con Diffusers
Il quick start installa Diffusers da Git. Per valutazioni riproducibili, usate un ambiente virtuale e fissate il commit provato.
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
Per più riferimenti passate image=[...]. Registrate seed, prompt completo, commit del runtime, precisione, risoluzione e step: senza questi dati il confronto non è riproducibile.
ComfyUI e serving
ComfyUI offre supporto nativo e workflow JSON ufficiali per generazione e modifica. È semplice per esperimenti visivi e offload della community. Diffusers è più chiaro per test Python controllati; vLLM-Omni e SGLang mirano a serving, batch, cache e FP8. Inviate esplicitamente 40 step e verificate il limite di riferimenti del runtime.
Licenza e uso commerciale
La licenza pubblicata non concede l'uso commerciale. Qwen Research License definisce Non-Commercial come ricerca o valutazione e limita a tale ambito uso, modifica e distribuzione dei materiali.
| Uso | Posizione della licenza pubblicata |
|---|---|
| Ricerca/valutazione interna | Consentita secondo le condizioni dell'accordo |
| Redistribuzione di pesi o derivati | Soggetta al limite non commerciale e agli avvisi |
| Prodotto a pagamento o servizio commerciale | Richiede una licenza commerciale separata |
| Contatto | model-business@notice.qwencloud.com |
Pesi scaricabili non significano Apache-2.0 o open source commerciale. Chi vende asset generati o integra il modello in un servizio a pagamento deve ottenere condizioni scritte e consulenza legale, senza dedurre diritti dalla parola “open-source” nell'annuncio.
Per chi ha senso
Valutatelo se la trasparenza nativa elimina il ritaglio dello sfondo, servono più persone/prodotti/stili come riferimenti, volete generazione ed editing locali in un modello, avete oltre 32 GB o accettate quantizzazione/offload e l'uso è davvero ricerca non commerciale.
Aspettate se manca la licenza commerciale, serve 2K plug-and-play su 24 GB, l'aderenza esatta al prompt conta più dell'alfa, occorrono dati maturi sulla tipografia multilingue o vi serve oggi un'API Qwen-Image-2.1 gestita da OmniaKey.
Per un'API immagini già disponibile, consultate la recensione Nano Banana 2 vs Pro. Il catalogo modelli è la fonte corretta per la disponibilità OmniaKey.
Limiti della recensione
La generazione personalizzata non è terminata perché il Demo era occupato. Le osservazioni visive derivano da quattro esempi ufficiali selezionati. Il confronto indipendente contiene solo 15 compiti text-to-image e non misura editing o trasparenza. I dati hardware provengono da GB200/GB300, non RTX consumer. Questa è analisi tecnica, non consulenza legale.
Domande frequenti
Qwen-Image-2.1 è open source?
Codice e pesi sono scaricabili pubblicamente e Qwen lo definisce open-source. Tuttavia, i pesi usano una licenza di ricerca che limita il commerciale. “Open-weight con licenza di ricerca” è più preciso di open source senza restrizioni.
Quanta VRAM richiede Qwen-Image-2.1?
I file principali totalizzano circa 33.1 GB. vLLM-Omni ha misurato 34.0 GB in BF16 e 27.5-28.1 GB con encoder testo FP8 su GB300. Risoluzione, precisione, offload, runtime e GPU cambiano il risultato.
Funziona su RTX 3090 o 4090?
Non con il percorso BF16 completo .to("cuda") dell'esempio ufficiale. Quantizzazione e offload possono rendere possibili 24 GB, ma i dati ufficiali non dimostrano velocità o stabilità 2K nativa su tali schede.
Qwen-Image-2.1 supporta ComfyUI?
Sì. ComfyUI ha pubblicato supporto nativo e workflow ufficiali text-to-image e editing il giorno del lancio.
Quante immagini di riferimento supporta?
Diffusers ufficiale arriva a 10; l'attuale vLLM-Omni a 4. Controllate il runtime realmente distribuito.
Si può usare commercialmente?
La Qwen Research License pubblica non lo consente. Richiedete una licenza separata a model-business@notice.qwencloud.com e una verifica legale del caso d'uso.
Qwen-Image-2.1 è disponibile su OmniaKey?
No al 21 settembre 2026. Il catalogo contiene route Qwen Image 3, ma non Qwen/Qwen-Image-2.1. Questa recensione non annuncia disponibilità.
Fonti primarie
- Annuncio ufficiale Qwen
- Repository e quick start
- Qwen Research License
- File del modello su Hugging Face
- Workflow ComfyUI text-to-image
- Workflow ComfyUI di editing
- Ricetta vLLM-Omni
- Qwen-Image-Bench
- GenAI Image Showdown indipendente
Evidenze verificate il 2026-09-21. Runtime, limiti e opzioni di licenza possono cambiare; riaprite le fonti primarie prima di decidere per la produzione.