Model Jev kini terintegrasi dan sudah tersedia · Selamat menggunakan
blog
Panduan

Ulasan Qwen-Image-2.1

RGBA native dan pengeditan multi-referensi adalah keunggulan nyata, tetapi lisensi khusus riset dan kebutuhan memori praktis sekitar 28-34 GB membuat model ini lebih cocok dievaluasi daripada dijadikan pilihan komersial default.

14 menit bacaOmniaKey
Qwen-Image-2.1generator gambar AIedit gambarComfyUIVRAM

Ulasan Qwen-Image-2.1 ini menemukan model gambar open-weight yang menarik karena dua kemampuan langka: keluaran RGBA native dan satu pipeline untuk generasi sekaligus pengeditan. Ada dua batas penting: bobot publik memakai lisensi riset nonkomersial, dan file utamanya berukuran sekitar 33.1 GB sebelum overhead inferensi.

Model ini layak diuji untuk aset produk transparan, stiker, ekstraksi subjek, dan komposisi dengan banyak referensi. Namun, model ini belum menjadi pilihan termudah untuk produk gambar komersial atau GPU 24 GB tanpa optimasi.

Diperiksa pada 21 September 2026. Kami meninjau pengumuman, repositori, file Hugging Face, lisensi, petunjuk Diffusers/ComfyUI, resep vLLM-Omni, grafik benchmark Qwen, dan GenAI Image Showdown independen. Empat keluaran resmi juga diunduh dan diperiksa. Generasi khusus di Demo Hugging Face publik tidak selesai karena Space sedang sibuk; jadi ini adalah ulasan peluncuran berbasis bukti, bukan benchmark mandiri. Galeri resmi berisi sampel pilihan vendor.

Ulasan Qwen-Image-2.1: jawaban singkat

PertanyaanJawaban terverifikasi
Apa model ini?Model terpadu text-to-image dan edit gambar, ID Qwen/Qwen-Image-2.1
ArsitekturGenerator visual 7B, 32 lapisan Single-Stream DiT, encoder Qwen3-VL 8B
Resolusi2K native; default Diffusers 2048x2048
TransparansiGenerasi dan pengeditan RGBA empat kanal secara native
Gambar referensiHingga 10 pada pipeline resmi; 4 pada vLLM-Omni saat ini
Sampling40 langkah pada contoh resmi Diffusers
Ukuran lokalSekitar 33.1 GB untuk encoder, Transformer, dan VAE sebelum overhead
LisensiQwen Research License, hanya riset/evaluasi nonkomersial
OmniaKeyBelum ada di katalog per 2026-09-21

Alasan terbaik untuk mengujinya bukan posisi di papan skor, melainkan kombinasi alfa nyata, sepuluh referensi, dan edit lokal. Lisensi, memori, dan minimnya evaluasi independen menjadi alasan kuat untuk tidak langsung memasukkannya ke produksi.

Apa itu Qwen-Image-2.1?

Qwen merilis Qwen-Image-2.1 pada 20 September 2026. Text-to-image, edit satu gambar, komposisi multi-referensi, mask, anotasi yang dilukis, dan ekstraksi subjek transparan menggunakan pipeline yang sama.

Label 7B hanya menjelaskan generator visual, bukan seluruh stack yang dimuat:

  • generator visual 7B dengan 32 lapisan Single-Stream DiT;
  • Qwen3-VL 8B untuk membaca prompt dan gambar referensi;
  • VAE 64 kanal latent, kompresi spasial 16x, dan input/output empat kanal;
  • RGB, RGBA, generasi, dan edit dalam satu model.

Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang, dan LightX2V mengumumkan dukungan pada hari pertama. Batasnya spesifik runtime: Diffusers resmi mendukung sepuluh referensi, tetapi vLLM-Omni saat ini menolak gambar kelima.

Apa yang ditunjukkan sampel resmi

Kami memeriksa file asli, bukan sekadar thumbnail. Sampel poster menulis dua baris bahasa Inggris yang diminta dengan benar dan memiliki hierarki tipografi yang rapi. Storyboard menghasilkan tepat enam panel dengan robot kecil yang tetap dikenali. Gambar produk menunjukkan refraksi kaca dan highlight yang meyakinkan.

Sampel transparan adalah PNG RGBA 1664x2496 dengan nilai alfa dari 0 hingga 255. Ada piksel yang benar-benar transparan dan opak, bukan pola kotak-kotak yang digambar ke gambar RGB. Ini adalah pembeda paling jelas dari rilis tersebut.

Keempatnya adalah contoh resmi terkurasi, bukan pengujian buta. Karena lisensi riset, kami tidak menerbitkan ulang file tersebut; kami menautkan galeri resmi dan melaporkan properti yang dapat diverifikasi.

Benchmark Qwen-Image-2.1

Grafik Qwen melaporkan skor 60.28 pada Qwen-Image-Bench. Angka ini berguna sebagai bukti vendor, tetapi bukan peringkat independen karena benchmark, agregasi, dan evaluasi berasal dari penerbit model.

GenAI Image Showdown yang independen memakai 15 tugas sulit untuk kepatuhan prompt, mengizinkan penyesuaian prompt per model, serta melarang editing dan inpainting.

ModelTugas lulusCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
Qwen-Image awal4 / 1568%

Versi 2.1 meningkatkan jumlah lulus dari 4 menjadi 7, sedangkan metrik compliance terpisah berubah dari 68% menjadi 67%. Ini bukan kontradiksi karena keduanya mengukur hal yang berbeda. Dalam pengujian kecil ini, 2.1 lebih baik dari versi awal tetapi belum memimpin pada instruksi kompleks.

Skor resmi 60.28 dan hasil independen 7 / 15 tidak boleh digabungkan menjadi satu peringkat karena tugas dan sistem penilaiannya berbeda.

2K native, RGBA, dan edit gambar

Diffusers memakai 2048x2048 dan 40 langkah secara default. Qwen juga merekomendasikan 2400x1792 untuk 4:3, 1792x2400 untuk 3:4, 2752x1536 untuk 16:9, dan 1536x2752 untuk 9:16.

“2K native” menjelaskan kanvas target; istilah ini tidak menjamin teks kecil yang sempurna, jumlah objek yang tepat, atau detail semantik tambahan. Resolusi dan kepatuhan prompt harus diuji terpisah.

Pengeditan mendukung hingga sepuluh referensi di Diffusers, penjagaan identitas orang/produk, lingkaran atau cat untuk instruksi lokal, mask terpisah, ekstraksi subjek, dan layer transparan. Untuk RGBA, Qwen menyarankan prompt yang menyebut kanal alfa dan latar transparan secara eksplisit, lalu menyimpan PNG. JPEG tidak menyimpan alfa.

Kebutuhan VRAM Qwen-Image-2.1

KomponenPerkiraan ukuran file
Encoder teks/visi Qwen3-VL17.5 GB
DiT Transformer14.2 GB
RGBA VAE1.4 GB
Total33.1 GB

Ukuran file tidak sama dengan puncak VRAM, tetapi jalur BF16 resmi .to("cuda") bukan konfigurasi nyaman untuk 24 GB. vLLM-Omni mengukur satu NVIDIA GB300 pada 1024x1024 dan 40 langkah:

KonfigurasiPuncak memoriWaktu per gambar
BF1634.0 GB3.28-4.49 dtk
DiT FP8, img_mlp sensitif tetap BF1632.0-32.7 GB3.36-4.71 dtk
Encoder teks FP827.5-28.1 GB3.43-4.77 dtk

Itu adalah pengukuran GB300 pada 1024px, bukan RTX 3090/4090 atau 2K default. FP8 terutama menghemat memori dan tidak mempercepat pengujian tersebut. GPU 24 GB mungkin bekerja dengan kuantisasi, CPU offload, VAE tiling, atau workflow ComfyUI komunitas; anggap ini proyek optimasi, bukan baseline yang dijamin.

Instalasi lokal dengan Diffusers

Quick start resmi memasang Diffusers dari Git. Gunakan virtual environment dan kunci commit yang diuji untuk evaluasi yang dapat direproduksi.

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

Untuk beberapa referensi, kirim image=[...]. Catat seed, prompt lengkap, commit runtime, presisi, resolusi, dan jumlah langkah; tanpa itu, perbandingan kualitas tidak dapat direproduksi.

ComfyUI dan serving

ComfyUI memiliki dukungan native dan workflow JSON resmi untuk generasi dan pengeditan. Ini mudah untuk eksperimen visual dan offload komunitas. Diffusers lebih jelas untuk evaluasi Python terkontrol; vLLM-Omni dan SGLang ditujukan untuk serving, batch, cache, dan FP8. Kirim 40 langkah secara eksplisit dan periksa batas referensi runtime.

Lisensi dan penggunaan komersial

Lisensi yang diterbitkan tidak memberi hak penggunaan komersial. Qwen Research License mendefinisikan Non-Commercial sebagai riset atau evaluasi, lalu membatasi penggunaan, modifikasi, dan distribusi materi untuk tujuan nonkomersial.

PenggunaanPosisi lisensi publik
Riset/evaluasi internalDiizinkan sesuai syarat perjanjian
Distribusi bobot atau turunannyaTerikat batas nonkomersial dan pemberitahuan
Produk berbayar atau layanan komersialMemerlukan lisensi komersial terpisah
Kontakmodel-business@notice.qwencloud.com

Bobot yang dapat diunduh bukan berarti Apache-2.0 atau open source komersial. Jika Anda akan menjual aset hasil generasi atau memakai model dalam layanan berbayar, dapatkan syarat tertulis dan nasihat hukum, bukan menyimpulkan hak dari istilah “open-source” pada pengumuman.

Siapa yang sebaiknya memakai model ini?

Evaluasi jika transparansi native menghapus langkah background removal, Anda membutuhkan beberapa orang/produk/gaya sebagai referensi, menginginkan generasi dan edit lokal dalam satu model, memiliki lebih dari 32 GB atau menerima kuantisasi/offload, serta penggunaannya benar-benar riset nonkomersial.

Tunggu jika belum memiliki lisensi komersial, perlu 2K plug-and-play pada 24 GB, lebih mementingkan kepatuhan prompt yang presisi, membutuhkan data tipografi multibahasa yang matang, atau memerlukan API Qwen-Image-2.1 terkelola di OmniaKey saat ini.

Untuk API gambar yang sudah tersedia, lihat ulasan Nano Banana 2 vs Pro. Katalog model adalah sumber kebenaran untuk ketersediaan OmniaKey.

Batas ulasan ini

Generasi khusus tidak selesai karena Demo sibuk. Pengamatan visual berasal dari empat contoh resmi terpilih. Perbandingan independen hanya berisi 15 tugas text-to-image dan tidak mengukur edit atau transparansi. Data hardware berasal dari GB200/GB300, bukan RTX konsumen. Artikel ini analisis teknis, bukan nasihat hukum.

Pertanyaan umum

Apakah Qwen-Image-2.1 open source?

Kode dan bobot dapat diunduh publik dan Qwen menyebutnya open-source. Namun, bobot memakai lisensi riset yang membatasi penggunaan komersial. “Open-weight dengan lisensi riset” lebih tepat daripada open source tanpa batas.

Berapa VRAM yang dibutuhkan Qwen-Image-2.1?

File utama berjumlah sekitar 33.1 GB. vLLM-Omni mengukur 34.0 GB untuk BF16 dan 27.5-28.1 GB dengan encoder teks FP8 di GB300. Resolusi, presisi, offload, runtime, dan GPU mengubah hasil.

Apakah bisa berjalan di RTX 3090 atau 4090?

Tidak dengan jalur BF16 penuh .to("cuda") pada contoh resmi. Kuantisasi dan offload mungkin memungkinkan 24 GB, tetapi bukti resmi saat peluncuran belum menunjukkan kecepatan atau stabilitas 2K native pada kartu tersebut.

Apakah Qwen-Image-2.1 mendukung ComfyUI?

Ya. ComfyUI merilis dukungan native dan workflow resmi text-to-image serta pengeditan pada hari peluncuran.

Berapa banyak gambar referensi yang didukung?

Diffusers resmi mendukung hingga 10; vLLM-Omni saat ini 4. Periksa runtime yang benar-benar digunakan.

Apakah boleh digunakan secara komersial?

Qwen Research License publik tidak memberikan izin tersebut. Hubungi model-business@notice.qwencloud.com untuk lisensi terpisah dan tinjau penggunaan Anda secara hukum.

Apakah Qwen-Image-2.1 tersedia di OmniaKey?

Tidak pada 21 September 2026. Katalog memuat rute Qwen Image 3, tetapi bukan Qwen/Qwen-Image-2.1. Ulasan ini bukan pengumuman ketersediaan.

Sumber primer

Bukti diperiksa pada 2026-09-21. Runtime, batas, dan opsi lisensi dapat berubah; buka kembali sumber primer sebelum keputusan produksi.