Qwen-Image-2.1 incelemesi
Yerel RGBA ve çoklu referans düzenleme güçlü farklar yaratıyor; ancak yalnızca araştırmaya izin veren lisans ve yaklaşık 28-34 GB pratik bellek eşiği, modeli ticari varsayılandan çok değerlendirme adayı yapıyor.
Bu Qwen-Image-2.1 incelemesi, iki sıra dışı güce sahip ilginç bir açık ağırlıklı görsel modeli gösteriyor: yerel RGBA çıktısı ve üretim ile düzenleme için tek pipeline. İki önemli sınır da var: herkese açık ağırlıklar ticari olmayan araştırma lisansı altında ve temel dosyalar çalışma ek yükünden önce yaklaşık 33.1 GB.
Şeffaf ürün asset'leri, sticker, nesne ayırma ve çoklu referans kompozisyonları için değerlendirilmeye değer. Henüz ticari bir görsel ürünü veya optimizasyonsuz 24 GB GPU için en kolay varsayılan değil.
21 Eylül 2026'da doğrulandı. Resmi duyuruyu, depoyu, Hugging Face dosyalarını, lisansı, Diffusers/ComfyUI talimatlarını, vLLM-Omni tarifini, Qwen benchmark grafiğini ve bağımsız GenAI Image Showdown'ı inceledik. Dört resmi örneğin özgün dosyalarını da kontrol ettik. Herkese açık Hugging Face Demo yoğun olduğu için özel üretim tamamlanmadı; bu nedenle yazı kanıta dayalı bir çıkış incelemesidir, kendi benchmark'ımız değildir. Resmi galeri üretici tarafından seçilmiş örneklerden oluşur.
Qwen-Image-2.1 incelemesi: kısa yanıt
| Soru | Doğrulanmış yanıt |
|---|---|
| Nedir? | Qwen/Qwen-Image-2.1 kimlikli birleşik metinden görsele ve düzenleme modeli |
| Mimari | 7B görsel üretici, 32 Single-Stream DiT katmanı, Qwen3-VL 8B kodlayıcı |
| Çözünürlük | Yerel 2K; Diffusers varsayılanı 2048x2048 |
| Şeffaflık | Yerel dört kanallı RGBA üretim ve düzenleme |
| Referans görseller | Resmi pipeline'da 10'a kadar; güncel vLLM-Omni'de 4 |
| Örnekleme | Resmi Diffusers örneğinde 40 adım |
| Yerel boyut | Kodlayıcı, Transformer ve VAE yaklaşık 33.1 GB; çalışma ek yükü hariç |
| Lisans | Qwen Research License, yalnızca ticari olmayan araştırma/değerlendirme |
| OmniaKey | 2026-09-21 tarihinde katalogda yok |
Denemek için en güçlü neden sıralama değil, gerçek alfa, on referans ve yerel düzenleme birleşimidir. Lisans, bellek ve sınırlı bağımsız değerlendirme ise doğrudan production'a geçmemek için somut nedenlerdir.
Qwen-Image-2.1 nedir?
Qwen modeli 20 Eylül 2026 tarihinde yayımladı. Metinden görsele üretim, tek görsel düzenleme, çoklu referans kompozisyonu, maskeler, boyanmış işaretler ve şeffaf nesne çıkarımı aynı pipeline'ı kullanır.
“7B” bütün yükü değil, yalnızca görsel üreticiyi tanımlar:
- 7B parametreli, 32 Single-Stream DiT katmanlı görsel üretici;
- prompt ve referansları birlikte okuyan Qwen3-VL 8B;
- 64 latent kanallı, 16x mekansal sıkıştırmalı, dört kanal giriş/çıkışlı VAE;
- RGB, RGBA, üretim ve düzenleme tek modelde.
Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang ve LightX2V ilk gün destek duyurdu. Sınırlar runtime'a bağlıdır: resmi Diffusers on referans kabul ederken güncel vLLM-Omni beşinci görseli reddeder.
Resmi örnekler gerçekte ne gösteriyor?
Yalnızca küçük önizlemeleri değil özgün dosyaları inceledik. Poster istenen iki İngilizce satırı doğru yazdı ve tutarlı tipografik hiyerarşi sundu. Storyboard tam altı panel üretti ve küçük robotu tanınır tuttu. Ürün görselindeki cam kırılması ve yansımalar ikna ediciydi.
Şeffaf örnek 1664x2496 RGBA PNG idi ve alfa değerleri 0 ile 255 arasındaydı. RGB görsele çizilmiş dama değil, gerçekten tam şeffaf ve opak pikseller içeriyor. Sürümün en açık ayırt edici yeteneği bu.
Bunlar kör test değil, seçilmiş resmi örneklerdir. Araştırma lisansı nedeniyle dosyaları burada yeniden yayımlamıyor, resmi galeriye bağlantı verip doğrulanabilir özellikleri aktarıyoruz.
Qwen-Image-2.1 benchmark sonuçları
Qwen grafiği Qwen-Image-Bench'te 60.28 bildiriyor. Bu yararlı bir üretici verisidir ancak bağımsız sıralama değildir; benchmark, toplama ve değerlendirme model yayıncısından gelir.
Bağımsız GenAI Image Showdown, prompt uyumu için 15 zor görev kullanır, modele göre prompt ayarlamaya izin verir, düzenleme ve inpainting'i yasaklar.
| Model | Geçilen görev | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| Orijinal Qwen-Image | 4 / 15 | 68% |
2.1 geçen görev sayısını 4'ten 7'ye çıkarırken ayrı compliance değeri 68%'den 67%'ye indi. Çelişki yoktur; metrikler farklı şeyleri ölçer. Küçük testte orijinalden iyi, karmaşık talimat uyumunda en güçlü kapalı modelden geridedir.
Resmi 60.28 ile bağımsız 7 / 15, görev ve puanlama farklı olduğu için tek sıralamada birleştirilemez.
Yerel 2K, RGBA ve görsel düzenleme
Diffusers varsayılan olarak 2048x2048 ve 40 adım kullanır. Qwen ayrıca 4:3 için 2400x1792, 3:4 için 1792x2400, 16:9 için 2752x1536, 9:16 için 1536x2752 önerir.
“Yerel 2K” hedef tuvali anlatır; küçük yazının kusursuz, nesne sayısının kesin veya anlamsal ayrıntının daha yüksek olmasını garanti etmez. Çözünürlük ve prompt uyumu ayrı testlerdir.
Düzenleme; Diffusers'ta on referansa kadar kullanım, kişi/ürün kimliğini koruma, daire veya boyamayla yerel talimat, ayrı maske, nesne çıkarma ve şeffaf katmanları kapsar. RGBA için prompt'ta alfa kanalı ve şeffaf arka plan açıkça istenmeli, PNG kaydedilmelidir. JPEG alfa saklamaz.
Qwen-Image-2.1 VRAM gereksinimi
| Bileşen | Yaklaşık dosya boyutu |
|---|---|
| Qwen3-VL metin/görsel kodlayıcı | 17.5 GB |
| DiT Transformer | 14.2 GB |
| RGBA VAE | 1.4 GB |
| Toplam | 33.1 GB |
Dosya boyutu tepe VRAM değildir, ancak resmi BF16 .to("cuda") yolu rahat bir 24 GB yapılandırma değildir. vLLM-Omni, tek NVIDIA GB300 üzerinde 1024x1024 ve 40 adımda şunları ölçtü:
| Yapılandırma | Tepe bellek | Görsel başına süre |
|---|---|---|
| BF16 | 34.0 GB | 3.28-4.49 sn |
DiT FP8, hassas img_mlp BF16 | 32.0-32.7 GB | 3.36-4.71 sn |
| Metin kodlayıcı FP8 | 27.5-28.1 GB | 3.43-4.77 sn |
Bunlar 1024px GB300 ölçümleridir; RTX 3090/4090 veya varsayılan 2K değildir. FP8 bu testte belleği azalttı ama hızlandırmadı. 24 GB kart nicemleme, CPU offload, VAE tiling ya da topluluk ComfyUI workflow'u ile çalışabilir; bunu garantili temel değil optimizasyon projesi olarak görün.
Diffusers ile yerel kurulum
Resmi hızlı başlangıç Diffusers'ı Git'ten kurar. Tekrarlanabilir değerlendirme için sanal ortam ve test edilen commit sabitlenmelidir.
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
Çoklu referans için image=[...] gönderilir. Seed, tam prompt, runtime commit'i, hassasiyet, çözünürlük ve adım sayısını kaydedin; aksi halde kalite karşılaştırması tekrarlanamaz.
ComfyUI ve sunum seçenekleri
ComfyUI yerel destek ve resmi metinden görsele/düzenleme JSON workflow'ları sunar. Görsel deneyler ve topluluk offload çözümleri için kolaydır. Kontrollü Python değerlendirmesinde Diffusers; sunum, batching, cache ve FP8 için vLLM-Omni/SGLang daha uygundur. 40 adımı açıkça gönderin ve runtime'ın referans sınırını doğrulayın.
Lisans ve ticari kullanım
Yayımlanan lisans ticari kullanıma izin vermez. Qwen Research License, Non-Commercial terimini araştırma veya değerlendirme olarak tanımlar ve materyallerin kullanım, değiştirme ve dağıtımını ticari olmayan amaçlarla sınırlar.
| Kullanım | Yayımlanan lisansın konumu |
|---|---|
| Kurum içi araştırma/değerlendirme | Sözleşme şartlarıyla izinli |
| Ağırlık veya türev dağıtımı | Ticari olmayan sınır ve bildirim şartları geçerli |
| Ücretli ürün veya ticari hizmet | Ayrı ticari lisans gerekli |
| İletişim | model-business@notice.qwencloud.com |
Ağırlıkların indirilebilir olması Apache-2.0 veya ticari açık kaynak anlamına gelmez. Üretilen asset'leri satacak ya da modeli ücretli hizmete koyacaksanız duyurudaki “open-source” sözcüğünden hak çıkarmak yerine yazılı koşul ve hukuk görüşü alın.
Kim değerlendirmeli?
Yerel şeffaflık arka plan kaldırma adımını siliyorsa, birden fazla kişi/ürün/stil referansı gerekiyorsa, tek yerel modelde üretim ve düzenleme isteniyorsa, 32 GB üzeri GPU veya nicemleme/offload kabul edilebiliyorsa ve kullanım gerçekten ticari olmayan araştırmaysa değerlendirin.
Ticari lisans yoksa, 24 GB üzerinde hazır 2K gerekiyorsa, kesin prompt uyumu alfadan önemliyse, olgun çok dilli tipografi verisi veya bugün OmniaKey üzerinde yönetilen Qwen-Image-2.1 API gerekiyorsa bekleyin.
Halihazırda sunulan bir görsel API için Nano Banana 2 ve Pro incelemesine bakın. OmniaKey kullanılabilirliğinin kaynağı model kataloğudur.
Bu incelemenin sınırları
Demo yoğun olduğu için özel üretim tamamlanmadı. Görsel gözlemler dört seçilmiş resmi örneğe dayanıyor. Bağımsız test yalnızca 15 metinden görsele görevi içeriyor; düzenleme veya şeffaflığı ölçmüyor. Donanım sayıları tüketici RTX değil GB200/GB300'den geliyor. Bu teknik analizdir, hukuki tavsiye değildir.
Sık sorulan sorular
Qwen-Image-2.1 açık kaynak mı?
Kod ve ağırlıklar açıkça indirilebilir ve Qwen open-source diyor. Ancak ağırlıklar ticari kullanımı sınırlayan araştırma lisansında. “Araştırma lisanslı açık ağırlık” daha doğru bir ifadedir.
Qwen-Image-2.1 ne kadar VRAM ister?
Temel dosyalar yaklaşık 33.1 GB. vLLM-Omni GB300'de BF16 için 34.0 GB, FP8 metin kodlayıcı için 27.5-28.1 GB ölçtü. Çözünürlük, hassasiyet, offload, runtime ve GPU sonucu değiştirir.
RTX 3090 veya 4090'da çalışır mı?
Resmi tam BF16 .to("cuda") yolu ile değil. Nicemleme ve offload 24 GB'ı mümkün kılabilir; ancak çıkış günü resmi verileri bu kartlarda hız veya yerel 2K kararlılığı kanıtlamaz.
ComfyUI desteği var mı?
Evet. ComfyUI çıkış gününde yerel destek ve resmi metinden görsele/düzenleme workflow'ları yayımladı.
Kaç referans görsel destekleniyor?
Resmi Diffusers 10'a kadar, güncel vLLM-Omni 4 kabul eder. Dağıtacağınız runtime'ı kontrol edin.
Ticari kullanılabilir mi?
Yayımlanan Qwen Research License buna izin vermez. Ayrı lisans için model-business@notice.qwencloud.com adresine başvurun ve kullanımınızı hukuken değerlendirin.
Qwen-Image-2.1 OmniaKey'de var mı?
21 Eylül 2026 itibarıyla hayır. Katalogda Qwen Image 3 rotaları var, Qwen/Qwen-Image-2.1 yok. Bu inceleme kullanılabilirlik duyurusu değildir.
Birincil kaynaklar
- Resmi Qwen duyurusu
- Resmi depo ve hızlı başlangıç
- Qwen Research License
- Hugging Face model dosyaları
- ComfyUI metinden görsele workflow
- ComfyUI düzenleme workflow
- vLLM-Omni tarifi
- Qwen-Image-Bench
- Bağımsız GenAI Image Showdown
Kanıtlar 2026-09-21 tarihinde kontrol edildi. Runtime, sınırlar ve lisans seçenekleri değişebilir; production kararı öncesi birincil kaynakları yeniden açın.