Jev モデルが統合され提供開始 · ぜひご利用ください
ブログ
ガイド

Qwen-Image-2.1 レビュー

ネイティブRGBAと複数参照画像の編集は魅力的ですが、研究用途限定ライセンスと約28〜34 GBの実用メモリ要件により、商用の標準モデルというより評価向けです。

読了目安 14分OmniaKey
Qwen-Image-2.1画像生成画像編集ComfyUIVRAM

この Qwen-Image-2.1 レビュー の結論は明快です。ネイティブRGBA出力と、生成・編集を1本にまとめたパイプラインは珍しく実用的です。一方、公開ウェイトは非商用の研究ライセンスで、主要ファイルだけでも約33.1 GBあります。「7BだからRTX 3090で簡単に動く」とは言えません。

透過商品素材、ステッカー、被写体抽出、複数参照画像の合成を研究するなら有力です。商用画像サービスへそのまま採用する前には、別途ライセンスとハードウェア設計が必要です。

2026年9月21日に事実確認。 公式発表、リポジトリ、Hugging Faceのファイル、ライセンス、Diffusers/ComfyUI手順、vLLM-Omniレシピ、Qwen公式ベンチマーク、独立系GenAI Image Showdownを確認し、公式サンプル4点の原本も調べました。公開Hugging Face Demoは混雑中で独自生成が完了しなかったため、本稿は証拠ベースの初期レビューであり、独自ベンチマークを名乗るものではありません。公式ギャラリーは選別済みのベンダーサンプルです。

Qwen-Image-2.1 レビュー:要点

質問確認できた答え
何のモデルかテキスト画像生成と画像編集を統合した Qwen/Qwen-Image-2.1
中核構成7Bビジュアル生成器、32層Single-Stream DiT、Qwen3-VL 8Bエンコーダー
解像度ネイティブ2K、公式Diffusers既定値は 2048x2048
透過4チャンネルRGBAの生成・編集にネイティブ対応
参照画像公式パイプラインは最大10枚、現行vLLM-Omniは4枚
サンプリング公式Diffusers例は40ステップ
ローカル容量エンコーダー、Transformer、VAEで約33.1 GB(実行時オーバーヘッド前)
ライセンスQwen Research License、非商用の研究・評価のみ
OmniaKey2026-09-21時点でカタログ未掲載

試す最大の理由は順位ではなく、本物のアルファ透過、最大10枚の参照、ローカル編集の組み合わせです。すぐ本番採用しない理由も、ライセンス、メモリ、独立評価の少なさと具体的です。

Qwen-Image-2.1とは

Qwen-Image-2.1は 2026年9月20日 に公開されました。テキスト画像生成、単一画像編集、複数画像合成、マスク、描画指示、透過切り抜きを同じパイプラインで処理します。

「7B」は画像生成部のみを指し、読み込む全体の規模ではありません。

  • 画像生成器:7Bパラメータ、32層Single-Stream DiT。
  • 条件エンコーダー:プロンプトと参照画像を読むQwen3-VL 8B。
  • VAE:64チャンネル潜在表現、16倍空間圧縮、4チャンネル入出力。
  • 統合タスク:RGB/RGBA、生成、編集を1モデルで扱う。

Diffusersの QwenImage21Pipeline、ComfyUI、vLLM-Omni、SGLang、LightX2Vが公開初日に対応しました。ただし上限はランタイムごとに異なります。Diffusersの公式構成は10参照を示しますが、現行vLLM-Omniは5枚目を拒否します。

公式サンプルを実ファイルで確認

文字組み

ポスター例は指定された英語2行を正しく描き、字形、階層、間隔も最初の候補として十分でした。ただし、選別された英語1例から多言語タイポグラフィの安定性までは証明できません。

6コマのストーリーボード

出力は正確に6コマで、小型ロボットの見た目も各コマで認識できる程度に保たれました。コマ数と人物一貫性には良い兆候ですが、詳細な物語連続性には複数シードの試験が必要です。

商品素材と透過PNG

ガラス製品の例は屈折、ハイライト、表面分離が説得力のある仕上がりでした。透過サンプルの原本は 1664x2496のRGBA PNG で、アルファ値は 0〜255。チェッカーボードを描いただけのRGBではなく、完全透過と完全不透過の画素を持っています。

研究用途限定ライセンスのため、本ページでは公式画像を再配布せず、公式ギャラリーへリンクして検証可能な属性だけを記載します。

Qwen-Image-2.1のベンチマーク

Qwenの公開チャートでは、Qwen-Image-Benchで 60.28 です。公式評価内での競争力は示しますが、ベンチマークと集計、評価系はいずれも公開元によるものなので、独立ランキングではありません。

独立系 GenAI Image Showdown は、編集・インペイントを禁止した15件の難しいプロンプト遵守課題を評価しています。

モデル合格タスクCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
初代Qwen-Image4 / 1568%

2.1は合格数を4から7へ伸ばしましたが、別指標のcomplianceは68%から67%です。指標が違うので矛盾ではありません。この小規模試験では初代より改善したものの、複雑な指示追従で最上位のクローズドモデルには届いていない、と読むのが妥当です。

公式60.28と独立7 / 15は、課題も採点も違うため合算できません。

ネイティブ2K、RGBA、画像編集

公式Diffusersの既定は 2048x2048、40デノイズステップです。推奨サイズは1:1の 2048x2048、4:3の 2400x1792、3:4の 1792x2400、16:9の 2752x1536、9:16の 1536x2752 などです。

ネイティブ2Kは生成キャンバスを示すだけで、小さい文字、物体数、意味的な細部が必ず正しくなるという意味ではありません。解像度と指示追従は別に評価すべきです。

編集は最大10枚の参照、人物・商品の同一性保持、丸や塗りによる局所指示、別マスク、被写体抽出、透過レイヤー編集を対象にします。透過画像ではプロンプトにRGBA、アルファチャンネル、透明背景を明記し、PNGで保存します。JPEGはアルファを保持できません。

Qwen-Image-2.1の必要VRAM

公式Hugging Faceの構成ファイルは次の規模です。

コンポーネントおよその保存サイズ
Qwen3-VLテキスト/視覚エンコーダー17.5 GB
DiT Transformer14.2 GB
RGBA VAE1.4 GB
合計33.1 GB

保存サイズとピークVRAMは同じではありませんが、公式BF16 .to("cuda") を24 GBへ素直に載せる構成ではありません。vLLM-OmniがNVIDIA GB300 1基、1024x1024、40ステップで測った値は次の通りです。

構成ピークメモリ1枚の時間
BF1634.0 GB3.28-4.49秒
DiT FP8、img_mlpはBF1632.0-32.7 GB3.36-4.71秒
テキストエンコーダーFP827.5-28.1 GB3.43-4.77秒

これは GB300 の1024px測定で、RTX 3090/4090や既定2Kの測定ではありません。FP8は主にメモリを減らし、この試験では高速化していません。24 GBでも量子化、CPUオフロード、VAE tiling、ComfyUIのコミュニティ構成で動く可能性はありますが、手軽な標準構成とは扱えません。

Diffusersでのローカル導入

公開初日の手順はDiffusersをGitから導入します。再現性のため、仮想環境と検証済みcommitの固定を推奨します。

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

複数参照編集は image=[...] を渡します。シード、完全なプロンプト、ランタイムcommit、精度、解像度、ステップ数を保存しない比較は再現できません。

ComfyUI対応

ComfyUIには公開初日からネイティブ対応と公式の生成・編集workflow JSONがあります。視覚的な試行やオフロード系ワークフローには扱いやすく、制御したPython評価にはDiffusersが向きます。vLLM-Omni/SGLangはサービング、バッチ、キャッシュ、FP8向けです。40ステップを明示し、各ランタイムの参照上限を確認してください。

ライセンスと商用利用

公開ライセンスのままでは商用利用できません。 Qwen Research LicenseはNon-Commercialを研究・評価のみに定義し、素材の利用、改変、配布を非商用目的に限定して許諾します。

用途公開ライセンス上の扱い
社内研究・評価契約条件に従い許可
ウェイトや派生物の再配布非商用範囲と表示条件に従う
有料製品・商用サービス別の商用ライセンスが必要
問い合わせmodel-business@notice.qwencloud.com

ダウンロード可能であることはApache-2.0や自由な商用利用を意味しません。販売用アセットや有料サービスで使う場合は、公開記事の「open-source」という表現から権利を推測せず、書面の商用条件と法的助言を得るべきです。

使うべき人、待つべき人

透過工程を省きたい研究、複数の人物・商品・スタイル参照、生成と編集を1モデルで試したい場合、32 GB以上のGPUまたは量子化/オフロードを受け入れられる場合に向きます。

商用許諾前、有効な24 GB・2K構成が必須、厳密な指示追従が最優先、多言語文字の成熟データが必要、または今すぐOmniaKey管理APIが必要なら待つべきです。

現在カタログにある画像APIを比較する場合は、Nano Banana 2とProの比較を参照してください。実際の提供状況はモデルカタログが正本です。

このレビューの限界

独自生成は公開Demo混雑で完了していません。視覚所見は4つの公式選別サンプルです。独立比較は15件のテキスト画像生成だけで、編集・透過を測りません。性能値はGB200/GB300由来で、消費者向けRTXではありません。また、本稿は技術分析であり法律助言ではありません。

よくある質問

Qwen-Image-2.1はオープンソースですか?

コードとウェイトは公開され、Qwenもopen-sourceと呼んでいます。ただしウェイトは商用を制限するQwen Research Licenseです。「自由なオープンソース」より「公開ウェイトの研究ライセンス」と表現する方が正確です。

Qwen-Image-2.1に必要なVRAMは?

主要ファイルは約33.1 GBです。GB300のvLLM-Omni測定はBF16で34.0 GB、テキストエンコーダーFP8で27.5-28.1 GBでした。解像度、精度、オフロード、ランタイム、GPUで変わります。

RTX 3090や4090で動きますか?

公式の完全BF16 .to("cuda") は24 GBに収まりません。量子化やオフロードで動く可能性はありますが、公開時点の公式証拠は消費者GPUの速度やネイティブ2K安定性を保証しません。

ComfyUIに対応していますか?

はい。公開初日にネイティブ対応と公式のテキスト画像生成・画像編集ワークフローが提供されました。

参照画像は何枚までですか?

公式Diffusersは最大10枚、現行vLLM-Omniは4枚です。実際に使うランタイムの上限を確認してください。

商用利用できますか?

公開Qwen Research Licenseは商用利用を許諾しません。model-business@notice.qwencloud.com へ別途ライセンスを問い合わせ、用途に応じた法的確認を行ってください。

OmniaKeyで利用できますか?

2026年9月21日時点では利用できません。OmniaKeyにはQwen Image 3系が掲載されていますが、Qwen/Qwen-Image-2.1 はありません。本稿は提供開始の告知ではありません。

一次情報

証拠は2026-09-21に確認しました。ランタイム、上限、ライセンス選択肢は変わるため、本番判断前に一次情報を再確認してください。