Il modello Jev è ora integrato e disponibile · Benvenuto
Blog
Guida

Recensione di Qwen-Image-2.1

RGBA nativo ed editing multi-riferimento sono punti di forza concreti, ma la licenza per sola ricerca e un minimo pratico di circa 28-34 GB rendono il modello più adatto alla valutazione che a un impiego commerciale predefinito.

14 min di letturaOmniaKey
Qwen-Image-2.1generazione immaginimodifica immaginiComfyUIVRAM

Questa Qwen-Image-2.1 recensione descrive un modello di immagini open-weight interessante per due capacità rare: output RGBA nativo e una sola pipeline per generazione e modifica. Evidenzia anche due limiti decisivi: i pesi pubblici hanno una licenza di ricerca non commerciale e i file principali occupano circa 33.1 GB prima dell'overhead di inferenza.

Vale la pena valutarlo per asset trasparenti, sticker, estrazione di soggetti e composizioni multi-riferimento. Non è ancora la scelta più semplice per un prodotto commerciale o per una GPU da 24 GB senza ottimizzazioni.

Verificato il 21 settembre 2026. Abbiamo controllato annuncio, repository, file Hugging Face, licenza, guide Diffusers/ComfyUI, ricetta vLLM-Omni, grafico Qwen e GenAI Image Showdown indipendente. Abbiamo anche scaricato quattro output ufficiali. Una generazione personalizzata sul Demo pubblico non è terminata perché lo Space era occupato: questa è quindi una recensione di lancio basata sulle prove, non un benchmark proprietario. La galleria ufficiale contiene esempi selezionati dal fornitore.

Qwen-Image-2.1 recensione: risposta breve

DomandaRisposta verificata
Cos'èModello unificato text-to-image e editing, ID Qwen/Qwen-Image-2.1
ArchitetturaGeneratore visivo 7B, 32 layer Single-Stream DiT, encoder Qwen3-VL 8B
Risoluzione2K nativo; Diffusers usa 2048x2048 per impostazione predefinita
TrasparenzaGenerazione e modifica RGBA nativa a quattro canali
Immagini di riferimentoFino a 10 nella pipeline ufficiale; 4 nell'attuale vLLM-Omni
Campionamento40 step nell'esempio Diffusers ufficiale
Ingombro localeCirca 33.1 GB per encoder, Transformer e VAE, prima dell'overhead
LicenzaQwen Research License, sola ricerca/valutazione non commerciale
OmniaKeyNon presente in catalogo al 2026-09-21

Il motivo migliore per provarlo non è la classifica, ma l'unione di alfa reale, dieci riferimenti ed editing locale. Licenza, memoria e poche valutazioni indipendenti sconsigliano invece un impiego immediato in produzione.

Cos'è Qwen-Image-2.1?

Qwen ha pubblicato Qwen-Image-2.1 il 20 settembre 2026. Generazione text-to-image, modifica di un'immagine, composizione multi-riferimento, maschere, indicazioni dipinte ed estrazione trasparente passano dalla stessa pipeline.

L'etichetta 7B indica soltanto il generatore visivo, non tutto lo stack caricato:

  • generatore visivo 7B con 32 layer Single-Stream DiT;
  • encoder Qwen3-VL 8B per prompt e immagini di riferimento;
  • VAE con 64 canali latenti, compressione spaziale 16x e quattro canali in ingresso/uscita;
  • RGB, RGBA, generazione e modifica in un modello.

Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang e LightX2V hanno annunciato supporto day-one. I limiti dipendono dal runtime: Diffusers documenta dieci riferimenti, mentre l'attuale vLLM-Omni rifiuta la quinta immagine.

Cosa mostrano gli esempi ufficiali

Abbiamo ispezionato i file originali. Il poster ha riprodotto correttamente entrambe le righe inglesi richieste, con gerarchia e spaziatura coerenti. Lo storyboard ha prodotto esattamente sei riquadri mantenendo riconoscibile il piccolo robot. L'immagine di prodotto mostra rifrazione e riflessi del vetro convincenti.

L'esempio trasparente è un PNG RGBA da 1664x2496 con alfa tra 0 e 255. Contiene pixel realmente trasparenti e opachi, non una scacchiera disegnata in RGB. È la capacità più chiaramente distintiva della release.

Sono esempi ufficiali selezionati, non un test cieco. Data la licenza di ricerca, non li ripubblichiamo: rimandiamo alla galleria e riportiamo proprietà verificabili.

Benchmark di Qwen-Image-2.1

Il grafico Qwen riporta 60.28 su Qwen-Image-Bench. È un dato utile del produttore, non una classifica indipendente, perché benchmark, aggregazione e valutazione provengono dall'editore del modello.

Il GenAI Image Showdown indipendente usa 15 compiti difficili di aderenza al prompt, consente di adattare il prompt per modello e vieta editing e inpainting.

ModelloCompiti superatiCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
Qwen-Image originale4 / 1568%

2.1 passa da 4 a 7 compiti superati, mentre la metrica separata compliance cambia dal 68% al 67%. Non è una contraddizione: misurano aspetti diversi. In questo test ridotto 2.1 migliora sull'originale, ma non guida nell'aderenza a istruzioni complesse.

Il 60.28 ufficiale e il 7 / 15 indipendente non si possono fondere in una classifica, perché usano compiti e punteggi diversi.

2K nativo, RGBA e modifica immagini

Diffusers usa 2048x2048 e 40 step per impostazione predefinita. Qwen raccomanda anche 2400x1792 per 4:3, 1792x2400 per 3:4, 2752x1536 per 16:9 e 1536x2752 per 9:16.

“2K nativo” indica la tela prevista; non garantisce testo piccolo perfetto, conteggi esatti o più dettaglio semantico. Risoluzione e fedeltà al prompt sono test separati.

L'editing supporta fino a dieci riferimenti in Diffusers, preservazione dell'identità di persone/prodotti, cerchi o pittura per modifiche locali, maschere separate, estrazione del soggetto e livelli trasparenti. Per RGBA, Qwen suggerisce di richiedere esplicitamente canale alfa e sfondo trasparente, salvando in PNG. JPEG non conserva l'alfa.

Requisiti VRAM di Qwen-Image-2.1

ComponenteDimensione serializzata approssimativa
Encoder testo/visione Qwen3-VL17.5 GB
Transformer DiT14.2 GB
VAE RGBA1.4 GB
Totale33.1 GB

La dimensione su disco non coincide con il picco VRAM, ma il percorso BF16 ufficiale .to("cuda") non è una configurazione comoda da 24 GB. vLLM-Omni ha misurato su una NVIDIA GB300, 1024x1024 e 40 step:

ConfigurazionePicco memoriaTempo per immagine
BF1634.0 GB3.28-4.49 s
DiT FP8, img_mlp sensibile in BF1632.0-32.7 GB3.36-4.71 s
Encoder testo FP827.5-28.1 GB3.43-4.77 s

Sono misure GB300 a 1024px, non RTX 3090/4090 né 2K predefinito. FP8 ha soprattutto ridotto la memoria e non ha accelerato il test. Una scheda da 24 GB può funzionare con quantizzazione, CPU offload, VAE tiling o workflow ComfyUI della community, ma va considerato un progetto di ottimizzazione e non una base garantita.

Installazione locale con Diffusers

Il quick start installa Diffusers da Git. Per valutazioni riproducibili, usate un ambiente virtuale e fissate il commit provato.

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

Per più riferimenti passate image=[...]. Registrate seed, prompt completo, commit del runtime, precisione, risoluzione e step: senza questi dati il confronto non è riproducibile.

ComfyUI e serving

ComfyUI offre supporto nativo e workflow JSON ufficiali per generazione e modifica. È semplice per esperimenti visivi e offload della community. Diffusers è più chiaro per test Python controllati; vLLM-Omni e SGLang mirano a serving, batch, cache e FP8. Inviate esplicitamente 40 step e verificate il limite di riferimenti del runtime.

Licenza e uso commerciale

La licenza pubblicata non concede l'uso commerciale. Qwen Research License definisce Non-Commercial come ricerca o valutazione e limita a tale ambito uso, modifica e distribuzione dei materiali.

UsoPosizione della licenza pubblicata
Ricerca/valutazione internaConsentita secondo le condizioni dell'accordo
Redistribuzione di pesi o derivatiSoggetta al limite non commerciale e agli avvisi
Prodotto a pagamento o servizio commercialeRichiede una licenza commerciale separata
Contattomodel-business@notice.qwencloud.com

Pesi scaricabili non significano Apache-2.0 o open source commerciale. Chi vende asset generati o integra il modello in un servizio a pagamento deve ottenere condizioni scritte e consulenza legale, senza dedurre diritti dalla parola “open-source” nell'annuncio.

Per chi ha senso

Valutatelo se la trasparenza nativa elimina il ritaglio dello sfondo, servono più persone/prodotti/stili come riferimenti, volete generazione ed editing locali in un modello, avete oltre 32 GB o accettate quantizzazione/offload e l'uso è davvero ricerca non commerciale.

Aspettate se manca la licenza commerciale, serve 2K plug-and-play su 24 GB, l'aderenza esatta al prompt conta più dell'alfa, occorrono dati maturi sulla tipografia multilingue o vi serve oggi un'API Qwen-Image-2.1 gestita da OmniaKey.

Per un'API immagini già disponibile, consultate la recensione Nano Banana 2 vs Pro. Il catalogo modelli è la fonte corretta per la disponibilità OmniaKey.

Limiti della recensione

La generazione personalizzata non è terminata perché il Demo era occupato. Le osservazioni visive derivano da quattro esempi ufficiali selezionati. Il confronto indipendente contiene solo 15 compiti text-to-image e non misura editing o trasparenza. I dati hardware provengono da GB200/GB300, non RTX consumer. Questa è analisi tecnica, non consulenza legale.

Domande frequenti

Qwen-Image-2.1 è open source?

Codice e pesi sono scaricabili pubblicamente e Qwen lo definisce open-source. Tuttavia, i pesi usano una licenza di ricerca che limita il commerciale. “Open-weight con licenza di ricerca” è più preciso di open source senza restrizioni.

Quanta VRAM richiede Qwen-Image-2.1?

I file principali totalizzano circa 33.1 GB. vLLM-Omni ha misurato 34.0 GB in BF16 e 27.5-28.1 GB con encoder testo FP8 su GB300. Risoluzione, precisione, offload, runtime e GPU cambiano il risultato.

Funziona su RTX 3090 o 4090?

Non con il percorso BF16 completo .to("cuda") dell'esempio ufficiale. Quantizzazione e offload possono rendere possibili 24 GB, ma i dati ufficiali non dimostrano velocità o stabilità 2K nativa su tali schede.

Qwen-Image-2.1 supporta ComfyUI?

Sì. ComfyUI ha pubblicato supporto nativo e workflow ufficiali text-to-image e editing il giorno del lancio.

Quante immagini di riferimento supporta?

Diffusers ufficiale arriva a 10; l'attuale vLLM-Omni a 4. Controllate il runtime realmente distribuito.

Si può usare commercialmente?

La Qwen Research License pubblica non lo consente. Richiedete una licenza separata a model-business@notice.qwencloud.com e una verifica legale del caso d'uso.

Qwen-Image-2.1 è disponibile su OmniaKey?

No al 21 settembre 2026. Il catalogo contiene route Qwen Image 3, ma non Qwen/Qwen-Image-2.1. Questa recensione non annuncia disponibilità.

Fonti primarie

Evidenze verificate il 2026-09-21. Runtime, limiti e opzioni di licenza possono cambiare; riaprite le fonti primarie prima di decidere per la produzione.