Qwen-Image-2.1 レビュー
ネイティブRGBAと複数参照画像の編集は魅力的ですが、研究用途限定ライセンスと約28〜34 GBの実用メモリ要件により、商用の標準モデルというより評価向けです。
この Qwen-Image-2.1 レビュー の結論は明快です。ネイティブRGBA出力と、生成・編集を1本にまとめたパイプラインは珍しく実用的です。一方、公開ウェイトは非商用の研究ライセンスで、主要ファイルだけでも約33.1 GBあります。「7BだからRTX 3090で簡単に動く」とは言えません。
透過商品素材、ステッカー、被写体抽出、複数参照画像の合成を研究するなら有力です。商用画像サービスへそのまま採用する前には、別途ライセンスとハードウェア設計が必要です。
2026年9月21日に事実確認。 公式発表、リポジトリ、Hugging Faceのファイル、ライセンス、Diffusers/ComfyUI手順、vLLM-Omniレシピ、Qwen公式ベンチマーク、独立系GenAI Image Showdownを確認し、公式サンプル4点の原本も調べました。公開Hugging Face Demoは混雑中で独自生成が完了しなかったため、本稿は証拠ベースの初期レビューであり、独自ベンチマークを名乗るものではありません。公式ギャラリーは選別済みのベンダーサンプルです。
Qwen-Image-2.1 レビュー:要点
| 質問 | 確認できた答え |
|---|---|
| 何のモデルか | テキスト画像生成と画像編集を統合した Qwen/Qwen-Image-2.1 |
| 中核構成 | 7Bビジュアル生成器、32層Single-Stream DiT、Qwen3-VL 8Bエンコーダー |
| 解像度 | ネイティブ2K、公式Diffusers既定値は 2048x2048 |
| 透過 | 4チャンネルRGBAの生成・編集にネイティブ対応 |
| 参照画像 | 公式パイプラインは最大10枚、現行vLLM-Omniは4枚 |
| サンプリング | 公式Diffusers例は40ステップ |
| ローカル容量 | エンコーダー、Transformer、VAEで約33.1 GB(実行時オーバーヘッド前) |
| ライセンス | Qwen Research License、非商用の研究・評価のみ |
| OmniaKey | 2026-09-21時点でカタログ未掲載 |
試す最大の理由は順位ではなく、本物のアルファ透過、最大10枚の参照、ローカル編集の組み合わせです。すぐ本番採用しない理由も、ライセンス、メモリ、独立評価の少なさと具体的です。
Qwen-Image-2.1とは
Qwen-Image-2.1は 2026年9月20日 に公開されました。テキスト画像生成、単一画像編集、複数画像合成、マスク、描画指示、透過切り抜きを同じパイプラインで処理します。
「7B」は画像生成部のみを指し、読み込む全体の規模ではありません。
- 画像生成器:7Bパラメータ、32層Single-Stream DiT。
- 条件エンコーダー:プロンプトと参照画像を読むQwen3-VL 8B。
- VAE:64チャンネル潜在表現、16倍空間圧縮、4チャンネル入出力。
- 統合タスク:RGB/RGBA、生成、編集を1モデルで扱う。
Diffusersの QwenImage21Pipeline、ComfyUI、vLLM-Omni、SGLang、LightX2Vが公開初日に対応しました。ただし上限はランタイムごとに異なります。Diffusersの公式構成は10参照を示しますが、現行vLLM-Omniは5枚目を拒否します。
公式サンプルを実ファイルで確認
文字組み
ポスター例は指定された英語2行を正しく描き、字形、階層、間隔も最初の候補として十分でした。ただし、選別された英語1例から多言語タイポグラフィの安定性までは証明できません。
6コマのストーリーボード
出力は正確に6コマで、小型ロボットの見た目も各コマで認識できる程度に保たれました。コマ数と人物一貫性には良い兆候ですが、詳細な物語連続性には複数シードの試験が必要です。
商品素材と透過PNG
ガラス製品の例は屈折、ハイライト、表面分離が説得力のある仕上がりでした。透過サンプルの原本は 1664x2496のRGBA PNG で、アルファ値は 0〜255。チェッカーボードを描いただけのRGBではなく、完全透過と完全不透過の画素を持っています。
研究用途限定ライセンスのため、本ページでは公式画像を再配布せず、公式ギャラリーへリンクして検証可能な属性だけを記載します。
Qwen-Image-2.1のベンチマーク
Qwenの公開チャートでは、Qwen-Image-Benchで 60.28 です。公式評価内での競争力は示しますが、ベンチマークと集計、評価系はいずれも公開元によるものなので、独立ランキングではありません。
独立系 GenAI Image Showdown は、編集・インペイントを禁止した15件の難しいプロンプト遵守課題を評価しています。
| モデル | 合格タスク | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| 初代Qwen-Image | 4 / 15 | 68% |
2.1は合格数を4から7へ伸ばしましたが、別指標のcomplianceは68%から67%です。指標が違うので矛盾ではありません。この小規模試験では初代より改善したものの、複雑な指示追従で最上位のクローズドモデルには届いていない、と読むのが妥当です。
公式60.28と独立7 / 15は、課題も採点も違うため合算できません。
ネイティブ2K、RGBA、画像編集
公式Diffusersの既定は 2048x2048、40デノイズステップです。推奨サイズは1:1の 2048x2048、4:3の 2400x1792、3:4の 1792x2400、16:9の 2752x1536、9:16の 1536x2752 などです。
ネイティブ2Kは生成キャンバスを示すだけで、小さい文字、物体数、意味的な細部が必ず正しくなるという意味ではありません。解像度と指示追従は別に評価すべきです。
編集は最大10枚の参照、人物・商品の同一性保持、丸や塗りによる局所指示、別マスク、被写体抽出、透過レイヤー編集を対象にします。透過画像ではプロンプトにRGBA、アルファチャンネル、透明背景を明記し、PNGで保存します。JPEGはアルファを保持できません。
Qwen-Image-2.1の必要VRAM
公式Hugging Faceの構成ファイルは次の規模です。
| コンポーネント | およその保存サイズ |
|---|---|
| Qwen3-VLテキスト/視覚エンコーダー | 17.5 GB |
| DiT Transformer | 14.2 GB |
| RGBA VAE | 1.4 GB |
| 合計 | 33.1 GB |
保存サイズとピークVRAMは同じではありませんが、公式BF16 .to("cuda") を24 GBへ素直に載せる構成ではありません。vLLM-OmniがNVIDIA GB300 1基、1024x1024、40ステップで測った値は次の通りです。
| 構成 | ピークメモリ | 1枚の時間 |
|---|---|---|
| BF16 | 34.0 GB | 3.28-4.49秒 |
DiT FP8、img_mlpはBF16 | 32.0-32.7 GB | 3.36-4.71秒 |
| テキストエンコーダーFP8 | 27.5-28.1 GB | 3.43-4.77秒 |
これは GB300 の1024px測定で、RTX 3090/4090や既定2Kの測定ではありません。FP8は主にメモリを減らし、この試験では高速化していません。24 GBでも量子化、CPUオフロード、VAE tiling、ComfyUIのコミュニティ構成で動く可能性はありますが、手軽な標準構成とは扱えません。
Diffusersでのローカル導入
公開初日の手順はDiffusersをGitから導入します。再現性のため、仮想環境と検証済みcommitの固定を推奨します。
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
複数参照編集は image=[...] を渡します。シード、完全なプロンプト、ランタイムcommit、精度、解像度、ステップ数を保存しない比較は再現できません。
ComfyUI対応
ComfyUIには公開初日からネイティブ対応と公式の生成・編集workflow JSONがあります。視覚的な試行やオフロード系ワークフローには扱いやすく、制御したPython評価にはDiffusersが向きます。vLLM-Omni/SGLangはサービング、バッチ、キャッシュ、FP8向けです。40ステップを明示し、各ランタイムの参照上限を確認してください。
ライセンスと商用利用
公開ライセンスのままでは商用利用できません。 Qwen Research LicenseはNon-Commercialを研究・評価のみに定義し、素材の利用、改変、配布を非商用目的に限定して許諾します。
| 用途 | 公開ライセンス上の扱い |
|---|---|
| 社内研究・評価 | 契約条件に従い許可 |
| ウェイトや派生物の再配布 | 非商用範囲と表示条件に従う |
| 有料製品・商用サービス | 別の商用ライセンスが必要 |
| 問い合わせ | model-business@notice.qwencloud.com |
ダウンロード可能であることはApache-2.0や自由な商用利用を意味しません。販売用アセットや有料サービスで使う場合は、公開記事の「open-source」という表現から権利を推測せず、書面の商用条件と法的助言を得るべきです。
使うべき人、待つべき人
透過工程を省きたい研究、複数の人物・商品・スタイル参照、生成と編集を1モデルで試したい場合、32 GB以上のGPUまたは量子化/オフロードを受け入れられる場合に向きます。
商用許諾前、有効な24 GB・2K構成が必須、厳密な指示追従が最優先、多言語文字の成熟データが必要、または今すぐOmniaKey管理APIが必要なら待つべきです。
現在カタログにある画像APIを比較する場合は、Nano Banana 2とProの比較を参照してください。実際の提供状況はモデルカタログが正本です。
このレビューの限界
独自生成は公開Demo混雑で完了していません。視覚所見は4つの公式選別サンプルです。独立比較は15件のテキスト画像生成だけで、編集・透過を測りません。性能値はGB200/GB300由来で、消費者向けRTXではありません。また、本稿は技術分析であり法律助言ではありません。
よくある質問
Qwen-Image-2.1はオープンソースですか?
コードとウェイトは公開され、Qwenもopen-sourceと呼んでいます。ただしウェイトは商用を制限するQwen Research Licenseです。「自由なオープンソース」より「公開ウェイトの研究ライセンス」と表現する方が正確です。
Qwen-Image-2.1に必要なVRAMは?
主要ファイルは約33.1 GBです。GB300のvLLM-Omni測定はBF16で34.0 GB、テキストエンコーダーFP8で27.5-28.1 GBでした。解像度、精度、オフロード、ランタイム、GPUで変わります。
RTX 3090や4090で動きますか?
公式の完全BF16 .to("cuda") は24 GBに収まりません。量子化やオフロードで動く可能性はありますが、公開時点の公式証拠は消費者GPUの速度やネイティブ2K安定性を保証しません。
ComfyUIに対応していますか?
はい。公開初日にネイティブ対応と公式のテキスト画像生成・画像編集ワークフローが提供されました。
参照画像は何枚までですか?
公式Diffusersは最大10枚、現行vLLM-Omniは4枚です。実際に使うランタイムの上限を確認してください。
商用利用できますか?
公開Qwen Research Licenseは商用利用を許諾しません。model-business@notice.qwencloud.com へ別途ライセンスを問い合わせ、用途に応じた法的確認を行ってください。
OmniaKeyで利用できますか?
2026年9月21日時点では利用できません。OmniaKeyにはQwen Image 3系が掲載されていますが、Qwen/Qwen-Image-2.1 はありません。本稿は提供開始の告知ではありません。
一次情報
- Qwen公式発表
- 公式リポジトリとQuick Start
- Qwen Research License
- Hugging Faceモデルファイル
- ComfyUIテキスト画像生成workflow
- ComfyUI画像編集workflow
- vLLM-Omniレシピ
- Qwen-Image-Bench
- 独立GenAI Image Showdown
証拠は2026-09-21に確認しました。ランタイム、上限、ライセンス選択肢は変わるため、本番判断前に一次情報を再確認してください。