Jev modeli artık entegre ve kullanımda · Hoş geldiniz
Blog
Rehber

Qwen-Image-2.1 incelemesi

Yerel RGBA ve çoklu referans düzenleme güçlü farklar yaratıyor; ancak yalnızca araştırmaya izin veren lisans ve yaklaşık 28-34 GB pratik bellek eşiği, modeli ticari varsayılandan çok değerlendirme adayı yapıyor.

14 dk okumaOmniaKey
Qwen-Image-2.1görsel üretmegörsel düzenlemeComfyUIVRAM

Bu Qwen-Image-2.1 incelemesi, iki sıra dışı güce sahip ilginç bir açık ağırlıklı görsel modeli gösteriyor: yerel RGBA çıktısı ve üretim ile düzenleme için tek pipeline. İki önemli sınır da var: herkese açık ağırlıklar ticari olmayan araştırma lisansı altında ve temel dosyalar çalışma ek yükünden önce yaklaşık 33.1 GB.

Şeffaf ürün asset'leri, sticker, nesne ayırma ve çoklu referans kompozisyonları için değerlendirilmeye değer. Henüz ticari bir görsel ürünü veya optimizasyonsuz 24 GB GPU için en kolay varsayılan değil.

21 Eylül 2026'da doğrulandı. Resmi duyuruyu, depoyu, Hugging Face dosyalarını, lisansı, Diffusers/ComfyUI talimatlarını, vLLM-Omni tarifini, Qwen benchmark grafiğini ve bağımsız GenAI Image Showdown'ı inceledik. Dört resmi örneğin özgün dosyalarını da kontrol ettik. Herkese açık Hugging Face Demo yoğun olduğu için özel üretim tamamlanmadı; bu nedenle yazı kanıta dayalı bir çıkış incelemesidir, kendi benchmark'ımız değildir. Resmi galeri üretici tarafından seçilmiş örneklerden oluşur.

Qwen-Image-2.1 incelemesi: kısa yanıt

SoruDoğrulanmış yanıt
Nedir?Qwen/Qwen-Image-2.1 kimlikli birleşik metinden görsele ve düzenleme modeli
Mimari7B görsel üretici, 32 Single-Stream DiT katmanı, Qwen3-VL 8B kodlayıcı
ÇözünürlükYerel 2K; Diffusers varsayılanı 2048x2048
ŞeffaflıkYerel dört kanallı RGBA üretim ve düzenleme
Referans görsellerResmi pipeline'da 10'a kadar; güncel vLLM-Omni'de 4
ÖrneklemeResmi Diffusers örneğinde 40 adım
Yerel boyutKodlayıcı, Transformer ve VAE yaklaşık 33.1 GB; çalışma ek yükü hariç
LisansQwen Research License, yalnızca ticari olmayan araştırma/değerlendirme
OmniaKey2026-09-21 tarihinde katalogda yok

Denemek için en güçlü neden sıralama değil, gerçek alfa, on referans ve yerel düzenleme birleşimidir. Lisans, bellek ve sınırlı bağımsız değerlendirme ise doğrudan production'a geçmemek için somut nedenlerdir.

Qwen-Image-2.1 nedir?

Qwen modeli 20 Eylül 2026 tarihinde yayımladı. Metinden görsele üretim, tek görsel düzenleme, çoklu referans kompozisyonu, maskeler, boyanmış işaretler ve şeffaf nesne çıkarımı aynı pipeline'ı kullanır.

“7B” bütün yükü değil, yalnızca görsel üreticiyi tanımlar:

  • 7B parametreli, 32 Single-Stream DiT katmanlı görsel üretici;
  • prompt ve referansları birlikte okuyan Qwen3-VL 8B;
  • 64 latent kanallı, 16x mekansal sıkıştırmalı, dört kanal giriş/çıkışlı VAE;
  • RGB, RGBA, üretim ve düzenleme tek modelde.

Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang ve LightX2V ilk gün destek duyurdu. Sınırlar runtime'a bağlıdır: resmi Diffusers on referans kabul ederken güncel vLLM-Omni beşinci görseli reddeder.

Resmi örnekler gerçekte ne gösteriyor?

Yalnızca küçük önizlemeleri değil özgün dosyaları inceledik. Poster istenen iki İngilizce satırı doğru yazdı ve tutarlı tipografik hiyerarşi sundu. Storyboard tam altı panel üretti ve küçük robotu tanınır tuttu. Ürün görselindeki cam kırılması ve yansımalar ikna ediciydi.

Şeffaf örnek 1664x2496 RGBA PNG idi ve alfa değerleri 0 ile 255 arasındaydı. RGB görsele çizilmiş dama değil, gerçekten tam şeffaf ve opak pikseller içeriyor. Sürümün en açık ayırt edici yeteneği bu.

Bunlar kör test değil, seçilmiş resmi örneklerdir. Araştırma lisansı nedeniyle dosyaları burada yeniden yayımlamıyor, resmi galeriye bağlantı verip doğrulanabilir özellikleri aktarıyoruz.

Qwen-Image-2.1 benchmark sonuçları

Qwen grafiği Qwen-Image-Bench'te 60.28 bildiriyor. Bu yararlı bir üretici verisidir ancak bağımsız sıralama değildir; benchmark, toplama ve değerlendirme model yayıncısından gelir.

Bağımsız GenAI Image Showdown, prompt uyumu için 15 zor görev kullanır, modele göre prompt ayarlamaya izin verir, düzenleme ve inpainting'i yasaklar.

ModelGeçilen görevCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
Orijinal Qwen-Image4 / 1568%

2.1 geçen görev sayısını 4'ten 7'ye çıkarırken ayrı compliance değeri 68%'den 67%'ye indi. Çelişki yoktur; metrikler farklı şeyleri ölçer. Küçük testte orijinalden iyi, karmaşık talimat uyumunda en güçlü kapalı modelden geridedir.

Resmi 60.28 ile bağımsız 7 / 15, görev ve puanlama farklı olduğu için tek sıralamada birleştirilemez.

Yerel 2K, RGBA ve görsel düzenleme

Diffusers varsayılan olarak 2048x2048 ve 40 adım kullanır. Qwen ayrıca 4:3 için 2400x1792, 3:4 için 1792x2400, 16:9 için 2752x1536, 9:16 için 1536x2752 önerir.

“Yerel 2K” hedef tuvali anlatır; küçük yazının kusursuz, nesne sayısının kesin veya anlamsal ayrıntının daha yüksek olmasını garanti etmez. Çözünürlük ve prompt uyumu ayrı testlerdir.

Düzenleme; Diffusers'ta on referansa kadar kullanım, kişi/ürün kimliğini koruma, daire veya boyamayla yerel talimat, ayrı maske, nesne çıkarma ve şeffaf katmanları kapsar. RGBA için prompt'ta alfa kanalı ve şeffaf arka plan açıkça istenmeli, PNG kaydedilmelidir. JPEG alfa saklamaz.

Qwen-Image-2.1 VRAM gereksinimi

BileşenYaklaşık dosya boyutu
Qwen3-VL metin/görsel kodlayıcı17.5 GB
DiT Transformer14.2 GB
RGBA VAE1.4 GB
Toplam33.1 GB

Dosya boyutu tepe VRAM değildir, ancak resmi BF16 .to("cuda") yolu rahat bir 24 GB yapılandırma değildir. vLLM-Omni, tek NVIDIA GB300 üzerinde 1024x1024 ve 40 adımda şunları ölçtü:

YapılandırmaTepe bellekGörsel başına süre
BF1634.0 GB3.28-4.49 sn
DiT FP8, hassas img_mlp BF1632.0-32.7 GB3.36-4.71 sn
Metin kodlayıcı FP827.5-28.1 GB3.43-4.77 sn

Bunlar 1024px GB300 ölçümleridir; RTX 3090/4090 veya varsayılan 2K değildir. FP8 bu testte belleği azalttı ama hızlandırmadı. 24 GB kart nicemleme, CPU offload, VAE tiling ya da topluluk ComfyUI workflow'u ile çalışabilir; bunu garantili temel değil optimizasyon projesi olarak görün.

Diffusers ile yerel kurulum

Resmi hızlı başlangıç Diffusers'ı Git'ten kurar. Tekrarlanabilir değerlendirme için sanal ortam ve test edilen commit sabitlenmelidir.

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

Çoklu referans için image=[...] gönderilir. Seed, tam prompt, runtime commit'i, hassasiyet, çözünürlük ve adım sayısını kaydedin; aksi halde kalite karşılaştırması tekrarlanamaz.

ComfyUI ve sunum seçenekleri

ComfyUI yerel destek ve resmi metinden görsele/düzenleme JSON workflow'ları sunar. Görsel deneyler ve topluluk offload çözümleri için kolaydır. Kontrollü Python değerlendirmesinde Diffusers; sunum, batching, cache ve FP8 için vLLM-Omni/SGLang daha uygundur. 40 adımı açıkça gönderin ve runtime'ın referans sınırını doğrulayın.

Lisans ve ticari kullanım

Yayımlanan lisans ticari kullanıma izin vermez. Qwen Research License, Non-Commercial terimini araştırma veya değerlendirme olarak tanımlar ve materyallerin kullanım, değiştirme ve dağıtımını ticari olmayan amaçlarla sınırlar.

KullanımYayımlanan lisansın konumu
Kurum içi araştırma/değerlendirmeSözleşme şartlarıyla izinli
Ağırlık veya türev dağıtımıTicari olmayan sınır ve bildirim şartları geçerli
Ücretli ürün veya ticari hizmetAyrı ticari lisans gerekli
İletişimmodel-business@notice.qwencloud.com

Ağırlıkların indirilebilir olması Apache-2.0 veya ticari açık kaynak anlamına gelmez. Üretilen asset'leri satacak ya da modeli ücretli hizmete koyacaksanız duyurudaki “open-source” sözcüğünden hak çıkarmak yerine yazılı koşul ve hukuk görüşü alın.

Kim değerlendirmeli?

Yerel şeffaflık arka plan kaldırma adımını siliyorsa, birden fazla kişi/ürün/stil referansı gerekiyorsa, tek yerel modelde üretim ve düzenleme isteniyorsa, 32 GB üzeri GPU veya nicemleme/offload kabul edilebiliyorsa ve kullanım gerçekten ticari olmayan araştırmaysa değerlendirin.

Ticari lisans yoksa, 24 GB üzerinde hazır 2K gerekiyorsa, kesin prompt uyumu alfadan önemliyse, olgun çok dilli tipografi verisi veya bugün OmniaKey üzerinde yönetilen Qwen-Image-2.1 API gerekiyorsa bekleyin.

Halihazırda sunulan bir görsel API için Nano Banana 2 ve Pro incelemesine bakın. OmniaKey kullanılabilirliğinin kaynağı model kataloğudur.

Bu incelemenin sınırları

Demo yoğun olduğu için özel üretim tamamlanmadı. Görsel gözlemler dört seçilmiş resmi örneğe dayanıyor. Bağımsız test yalnızca 15 metinden görsele görevi içeriyor; düzenleme veya şeffaflığı ölçmüyor. Donanım sayıları tüketici RTX değil GB200/GB300'den geliyor. Bu teknik analizdir, hukuki tavsiye değildir.

Sık sorulan sorular

Qwen-Image-2.1 açık kaynak mı?

Kod ve ağırlıklar açıkça indirilebilir ve Qwen open-source diyor. Ancak ağırlıklar ticari kullanımı sınırlayan araştırma lisansında. “Araştırma lisanslı açık ağırlık” daha doğru bir ifadedir.

Qwen-Image-2.1 ne kadar VRAM ister?

Temel dosyalar yaklaşık 33.1 GB. vLLM-Omni GB300'de BF16 için 34.0 GB, FP8 metin kodlayıcı için 27.5-28.1 GB ölçtü. Çözünürlük, hassasiyet, offload, runtime ve GPU sonucu değiştirir.

RTX 3090 veya 4090'da çalışır mı?

Resmi tam BF16 .to("cuda") yolu ile değil. Nicemleme ve offload 24 GB'ı mümkün kılabilir; ancak çıkış günü resmi verileri bu kartlarda hız veya yerel 2K kararlılığı kanıtlamaz.

ComfyUI desteği var mı?

Evet. ComfyUI çıkış gününde yerel destek ve resmi metinden görsele/düzenleme workflow'ları yayımladı.

Kaç referans görsel destekleniyor?

Resmi Diffusers 10'a kadar, güncel vLLM-Omni 4 kabul eder. Dağıtacağınız runtime'ı kontrol edin.

Ticari kullanılabilir mi?

Yayımlanan Qwen Research License buna izin vermez. Ayrı lisans için model-business@notice.qwencloud.com adresine başvurun ve kullanımınızı hukuken değerlendirin.

Qwen-Image-2.1 OmniaKey'de var mı?

21 Eylül 2026 itibarıyla hayır. Katalogda Qwen Image 3 rotaları var, Qwen/Qwen-Image-2.1 yok. Bu inceleme kullanılabilirlik duyurusu değildir.

Birincil kaynaklar

Kanıtlar 2026-09-21 tarihinde kontrol edildi. Runtime, sınırlar ve lisans seçenekleri değişebilir; production kararı öncesi birincil kaynakları yeniden açın.