Ulasan Qwen-Image-2.1
RGBA native dan pengeditan multi-referensi adalah keunggulan nyata, tetapi lisensi khusus riset dan kebutuhan memori praktis sekitar 28-34 GB membuat model ini lebih cocok dievaluasi daripada dijadikan pilihan komersial default.
Ulasan Qwen-Image-2.1 ini menemukan model gambar open-weight yang menarik karena dua kemampuan langka: keluaran RGBA native dan satu pipeline untuk generasi sekaligus pengeditan. Ada dua batas penting: bobot publik memakai lisensi riset nonkomersial, dan file utamanya berukuran sekitar 33.1 GB sebelum overhead inferensi.
Model ini layak diuji untuk aset produk transparan, stiker, ekstraksi subjek, dan komposisi dengan banyak referensi. Namun, model ini belum menjadi pilihan termudah untuk produk gambar komersial atau GPU 24 GB tanpa optimasi.
Diperiksa pada 21 September 2026. Kami meninjau pengumuman, repositori, file Hugging Face, lisensi, petunjuk Diffusers/ComfyUI, resep vLLM-Omni, grafik benchmark Qwen, dan GenAI Image Showdown independen. Empat keluaran resmi juga diunduh dan diperiksa. Generasi khusus di Demo Hugging Face publik tidak selesai karena Space sedang sibuk; jadi ini adalah ulasan peluncuran berbasis bukti, bukan benchmark mandiri. Galeri resmi berisi sampel pilihan vendor.
Ulasan Qwen-Image-2.1: jawaban singkat
| Pertanyaan | Jawaban terverifikasi |
|---|---|
| Apa model ini? | Model terpadu text-to-image dan edit gambar, ID Qwen/Qwen-Image-2.1 |
| Arsitektur | Generator visual 7B, 32 lapisan Single-Stream DiT, encoder Qwen3-VL 8B |
| Resolusi | 2K native; default Diffusers 2048x2048 |
| Transparansi | Generasi dan pengeditan RGBA empat kanal secara native |
| Gambar referensi | Hingga 10 pada pipeline resmi; 4 pada vLLM-Omni saat ini |
| Sampling | 40 langkah pada contoh resmi Diffusers |
| Ukuran lokal | Sekitar 33.1 GB untuk encoder, Transformer, dan VAE sebelum overhead |
| Lisensi | Qwen Research License, hanya riset/evaluasi nonkomersial |
| OmniaKey | Belum ada di katalog per 2026-09-21 |
Alasan terbaik untuk mengujinya bukan posisi di papan skor, melainkan kombinasi alfa nyata, sepuluh referensi, dan edit lokal. Lisensi, memori, dan minimnya evaluasi independen menjadi alasan kuat untuk tidak langsung memasukkannya ke produksi.
Apa itu Qwen-Image-2.1?
Qwen merilis Qwen-Image-2.1 pada 20 September 2026. Text-to-image, edit satu gambar, komposisi multi-referensi, mask, anotasi yang dilukis, dan ekstraksi subjek transparan menggunakan pipeline yang sama.
Label 7B hanya menjelaskan generator visual, bukan seluruh stack yang dimuat:
- generator visual 7B dengan 32 lapisan Single-Stream DiT;
- Qwen3-VL 8B untuk membaca prompt dan gambar referensi;
- VAE 64 kanal latent, kompresi spasial 16x, dan input/output empat kanal;
- RGB, RGBA, generasi, dan edit dalam satu model.
Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang, dan LightX2V mengumumkan dukungan pada hari pertama. Batasnya spesifik runtime: Diffusers resmi mendukung sepuluh referensi, tetapi vLLM-Omni saat ini menolak gambar kelima.
Apa yang ditunjukkan sampel resmi
Kami memeriksa file asli, bukan sekadar thumbnail. Sampel poster menulis dua baris bahasa Inggris yang diminta dengan benar dan memiliki hierarki tipografi yang rapi. Storyboard menghasilkan tepat enam panel dengan robot kecil yang tetap dikenali. Gambar produk menunjukkan refraksi kaca dan highlight yang meyakinkan.
Sampel transparan adalah PNG RGBA 1664x2496 dengan nilai alfa dari 0 hingga 255. Ada piksel yang benar-benar transparan dan opak, bukan pola kotak-kotak yang digambar ke gambar RGB. Ini adalah pembeda paling jelas dari rilis tersebut.
Keempatnya adalah contoh resmi terkurasi, bukan pengujian buta. Karena lisensi riset, kami tidak menerbitkan ulang file tersebut; kami menautkan galeri resmi dan melaporkan properti yang dapat diverifikasi.
Benchmark Qwen-Image-2.1
Grafik Qwen melaporkan skor 60.28 pada Qwen-Image-Bench. Angka ini berguna sebagai bukti vendor, tetapi bukan peringkat independen karena benchmark, agregasi, dan evaluasi berasal dari penerbit model.
GenAI Image Showdown yang independen memakai 15 tugas sulit untuk kepatuhan prompt, mengizinkan penyesuaian prompt per model, serta melarang editing dan inpainting.
| Model | Tugas lulus | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| Qwen-Image awal | 4 / 15 | 68% |
Versi 2.1 meningkatkan jumlah lulus dari 4 menjadi 7, sedangkan metrik compliance terpisah berubah dari 68% menjadi 67%. Ini bukan kontradiksi karena keduanya mengukur hal yang berbeda. Dalam pengujian kecil ini, 2.1 lebih baik dari versi awal tetapi belum memimpin pada instruksi kompleks.
Skor resmi 60.28 dan hasil independen 7 / 15 tidak boleh digabungkan menjadi satu peringkat karena tugas dan sistem penilaiannya berbeda.
2K native, RGBA, dan edit gambar
Diffusers memakai 2048x2048 dan 40 langkah secara default. Qwen juga merekomendasikan 2400x1792 untuk 4:3, 1792x2400 untuk 3:4, 2752x1536 untuk 16:9, dan 1536x2752 untuk 9:16.
“2K native” menjelaskan kanvas target; istilah ini tidak menjamin teks kecil yang sempurna, jumlah objek yang tepat, atau detail semantik tambahan. Resolusi dan kepatuhan prompt harus diuji terpisah.
Pengeditan mendukung hingga sepuluh referensi di Diffusers, penjagaan identitas orang/produk, lingkaran atau cat untuk instruksi lokal, mask terpisah, ekstraksi subjek, dan layer transparan. Untuk RGBA, Qwen menyarankan prompt yang menyebut kanal alfa dan latar transparan secara eksplisit, lalu menyimpan PNG. JPEG tidak menyimpan alfa.
Kebutuhan VRAM Qwen-Image-2.1
| Komponen | Perkiraan ukuran file |
|---|---|
| Encoder teks/visi Qwen3-VL | 17.5 GB |
| DiT Transformer | 14.2 GB |
| RGBA VAE | 1.4 GB |
| Total | 33.1 GB |
Ukuran file tidak sama dengan puncak VRAM, tetapi jalur BF16 resmi .to("cuda") bukan konfigurasi nyaman untuk 24 GB. vLLM-Omni mengukur satu NVIDIA GB300 pada 1024x1024 dan 40 langkah:
| Konfigurasi | Puncak memori | Waktu per gambar |
|---|---|---|
| BF16 | 34.0 GB | 3.28-4.49 dtk |
DiT FP8, img_mlp sensitif tetap BF16 | 32.0-32.7 GB | 3.36-4.71 dtk |
| Encoder teks FP8 | 27.5-28.1 GB | 3.43-4.77 dtk |
Itu adalah pengukuran GB300 pada 1024px, bukan RTX 3090/4090 atau 2K default. FP8 terutama menghemat memori dan tidak mempercepat pengujian tersebut. GPU 24 GB mungkin bekerja dengan kuantisasi, CPU offload, VAE tiling, atau workflow ComfyUI komunitas; anggap ini proyek optimasi, bukan baseline yang dijamin.
Instalasi lokal dengan Diffusers
Quick start resmi memasang Diffusers dari Git. Gunakan virtual environment dan kunci commit yang diuji untuk evaluasi yang dapat direproduksi.
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
Untuk beberapa referensi, kirim image=[...]. Catat seed, prompt lengkap, commit runtime, presisi, resolusi, dan jumlah langkah; tanpa itu, perbandingan kualitas tidak dapat direproduksi.
ComfyUI dan serving
ComfyUI memiliki dukungan native dan workflow JSON resmi untuk generasi dan pengeditan. Ini mudah untuk eksperimen visual dan offload komunitas. Diffusers lebih jelas untuk evaluasi Python terkontrol; vLLM-Omni dan SGLang ditujukan untuk serving, batch, cache, dan FP8. Kirim 40 langkah secara eksplisit dan periksa batas referensi runtime.
Lisensi dan penggunaan komersial
Lisensi yang diterbitkan tidak memberi hak penggunaan komersial. Qwen Research License mendefinisikan Non-Commercial sebagai riset atau evaluasi, lalu membatasi penggunaan, modifikasi, dan distribusi materi untuk tujuan nonkomersial.
| Penggunaan | Posisi lisensi publik |
|---|---|
| Riset/evaluasi internal | Diizinkan sesuai syarat perjanjian |
| Distribusi bobot atau turunannya | Terikat batas nonkomersial dan pemberitahuan |
| Produk berbayar atau layanan komersial | Memerlukan lisensi komersial terpisah |
| Kontak | model-business@notice.qwencloud.com |
Bobot yang dapat diunduh bukan berarti Apache-2.0 atau open source komersial. Jika Anda akan menjual aset hasil generasi atau memakai model dalam layanan berbayar, dapatkan syarat tertulis dan nasihat hukum, bukan menyimpulkan hak dari istilah “open-source” pada pengumuman.
Siapa yang sebaiknya memakai model ini?
Evaluasi jika transparansi native menghapus langkah background removal, Anda membutuhkan beberapa orang/produk/gaya sebagai referensi, menginginkan generasi dan edit lokal dalam satu model, memiliki lebih dari 32 GB atau menerima kuantisasi/offload, serta penggunaannya benar-benar riset nonkomersial.
Tunggu jika belum memiliki lisensi komersial, perlu 2K plug-and-play pada 24 GB, lebih mementingkan kepatuhan prompt yang presisi, membutuhkan data tipografi multibahasa yang matang, atau memerlukan API Qwen-Image-2.1 terkelola di OmniaKey saat ini.
Untuk API gambar yang sudah tersedia, lihat ulasan Nano Banana 2 vs Pro. Katalog model adalah sumber kebenaran untuk ketersediaan OmniaKey.
Batas ulasan ini
Generasi khusus tidak selesai karena Demo sibuk. Pengamatan visual berasal dari empat contoh resmi terpilih. Perbandingan independen hanya berisi 15 tugas text-to-image dan tidak mengukur edit atau transparansi. Data hardware berasal dari GB200/GB300, bukan RTX konsumen. Artikel ini analisis teknis, bukan nasihat hukum.
Pertanyaan umum
Apakah Qwen-Image-2.1 open source?
Kode dan bobot dapat diunduh publik dan Qwen menyebutnya open-source. Namun, bobot memakai lisensi riset yang membatasi penggunaan komersial. “Open-weight dengan lisensi riset” lebih tepat daripada open source tanpa batas.
Berapa VRAM yang dibutuhkan Qwen-Image-2.1?
File utama berjumlah sekitar 33.1 GB. vLLM-Omni mengukur 34.0 GB untuk BF16 dan 27.5-28.1 GB dengan encoder teks FP8 di GB300. Resolusi, presisi, offload, runtime, dan GPU mengubah hasil.
Apakah bisa berjalan di RTX 3090 atau 4090?
Tidak dengan jalur BF16 penuh .to("cuda") pada contoh resmi. Kuantisasi dan offload mungkin memungkinkan 24 GB, tetapi bukti resmi saat peluncuran belum menunjukkan kecepatan atau stabilitas 2K native pada kartu tersebut.
Apakah Qwen-Image-2.1 mendukung ComfyUI?
Ya. ComfyUI merilis dukungan native dan workflow resmi text-to-image serta pengeditan pada hari peluncuran.
Berapa banyak gambar referensi yang didukung?
Diffusers resmi mendukung hingga 10; vLLM-Omni saat ini 4. Periksa runtime yang benar-benar digunakan.
Apakah boleh digunakan secara komersial?
Qwen Research License publik tidak memberikan izin tersebut. Hubungi model-business@notice.qwencloud.com untuk lisensi terpisah dan tinjau penggunaan Anda secara hukum.
Apakah Qwen-Image-2.1 tersedia di OmniaKey?
Tidak pada 21 September 2026. Katalog memuat rute Qwen Image 3, tetapi bukan Qwen/Qwen-Image-2.1. Ulasan ini bukan pengumuman ketersediaan.
Sumber primer
- Pengumuman resmi Qwen
- Repositori dan quick start resmi
- Qwen Research License
- File model Hugging Face
- Workflow ComfyUI text-to-image
- Workflow pengeditan ComfyUI
- Resep vLLM-Omni
- Qwen-Image-Bench
- GenAI Image Showdown independen
Bukti diperiksa pada 2026-09-21. Runtime, batas, dan opsi lisensi dapat berubah; buka kembali sumber primer sebelum keputusan produksi.