Jev 模型已集成上线 · 欢迎使用
博客
指南

Qwen-Image-2.1 测评

Qwen-Image-2.1 的原生透明图和多参考图编辑很有辨识度,但研究用途许可与约 28-34 GB 的实际显存门槛,决定了它更适合评估,而不是直接成为商业生产默认模型。

14 分钟阅读OmniaKey
Qwen-Image-2.1AI 生图图像编辑ComfyUI显存

这篇 Qwen-Image-2.1 测评 的结论很明确:它是一款技术上很有意思的开放权重 7B 生图模型,原生 RGBA 透明图和统一的生成/编辑管线是最突出的优势;但它不是可以无条件商用的“开源模型”,完整权重约 33.1 GB,也不能简单说成“RTX 3090 轻松运行”。

如果你要研究透明商品素材、贴纸、抠图或多参考图合成,它值得测试。如果你要直接放进收费产品,则应先解决独立商用许可和部署硬件问题。

事实核查于 2026 年 9 月 21 日。 我们核对了官方发布文章、仓库、Hugging Face 文件、许可证、Diffusers/ComfyUI 文档、vLLM-Omni 实测、Qwen 官方基准图和独立 GenAI Image Showdown;还下载检查了 4 个官方原始样例。公开 Hugging Face Demo 当时繁忙,自定义生成没有完成,因此本文是基于证据的首发评测,不冒充第一手大样本实测。官方画廊属于厂商精选样例。

Qwen-Image-2.1 测评:先看结论

问题核实结果
模型是什么文生图与图像编辑统一模型,ID 为 Qwen/Qwen-Image-2.1
核心架构7B 视觉生成器、32 层 Single-Stream DiT、Qwen3-VL 8B 编码器
分辨率原生 2K;官方 Diffusers 默认 2048x2048
透明图原生四通道 RGBA 生成与编辑
参考图数量官方管线最多 10 张;当前 vLLM-Omni 实现最多 4 张
默认采样官方 Diffusers 示例为 40 步
本地体积编码器、Transformer 与 VAE 权重约 33.1 GB,尚未计运行开销
商用许可Qwen Research License,仅授予非商业研究/评估用途
OmniaKey 可用性截至 2026-09-21 未进入 OmniaKey 模型目录

最值得测的不是榜单名次,而是 真 Alpha 透明通道 + 10 张参考图 + 局部编辑 这一组能力。最不能忽略的也不是画质,而是许可证、显存和目前仍有限的独立评测。

Qwen-Image-2.1 是什么模型?

Qwen 于 2026 年 9 月 20 日发布 Qwen-Image-2.1。它用同一套管线完成文生图、单图编辑、多图合成、遮罩编辑和透明素材提取,不需要另载一个编辑模型。

“7B”只指视觉生成部分,并不代表整个推理管线只有 7B:

  • 视觉生成器有 7B 参数和 32 层 Single-Stream DiT;
  • 提示词与参考图由 Qwen3-VL 8B 文本/视觉编码器共同处理;
  • VAE 使用 64 通道潜空间、16 倍空间压缩和四通道输入输出;
  • RGBA、普通 RGB、生成和编辑共用一套模型。

首发当天,Diffusers 的 QwenImage21Pipeline、ComfyUI、vLLM-Omni、SGLang 和 LightX2V 都给出了支持。不过“模型最多 10 张参考图”不等于每个运行时都支持 10 张:当前 vLLM-Omni 会拒绝第 5 张条件图。

官方样例实际说明了什么

我们直接检查了官方原始文件,而不是只看网页缩略图。

英文排版

官方海报样例正确生成了提示词要求的两行英文,字形、层级和间距足以成为可继续修改的候选图。但一个精选英文海报不能证明多语言文字在不同种子下都稳定。

六格分镜

分镜图恰好有 6 格,小机器人在各格中保持了可辨认的一致性。它说明模型能处理“固定格数 + 角色连续性”,但仍需要用重复种子和真实剧本检验细节连贯性。

商品材质

玻璃商品样例的折射、高光和材质分层很有说服力,符合官方对真实纹理的描述。它仍然是厂商挑选的发布图,不是盲测。

不是棋盘格伪装的真透明 PNG

下载的透明样例是一张 1664x2496 的 RGBA PNG,Alpha 通道最小值为 0、最大值为 255,确实同时包含全透明和不透明像素。这是 2.1 最清晰的差异化能力。

本文不直接转载这些图片。权重和发布资产采用研究用途许可,因此我们链接官方画廊并报告可复查的文件属性。

Qwen-Image-2.1 跑分怎么看

Qwen 官方发布图给 Qwen-Image-2.1 的 Qwen-Image-Bench 总分为 60.28。这个成绩说明它在官方评测框架内竞争力很强,但基准、聚合方式与评测流程都来自模型发布方,不能当成独立排名。

独立的 GenAI Image Showdown 给出了更小、也更克制的结果。它包含 15 个高难度提示词遵循任务,允许针对模型调提示词,但禁止补绘与二次编辑。

模型通过任务Compliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
初代 Qwen-Image4 / 1568%

2.1 的通过数从 4 提升到 7,而单独计算的 compliance 从 68% 变成 67%。两项指标衡量方式不同,并不矛盾。合理结论是:2.1 在这个小样本里明显优于初代,但复杂指令遵循仍落后于最强闭源模型。

官方 60.28 和第三方 7 / 15 不能合并成一张总榜,它们不是同一批任务,也不是同一种计分方法。

原生 2K、RGBA 与多参考图编辑

官方 Diffusers 默认分辨率为 2048x2048,默认去噪 40 步。推荐尺寸包括:

比例推荐尺寸
1:12048x2048
4:3 / 3:42400x1792 / 1792x2400
3:2 / 2:32528x1696 / 1696x2528
16:9 / 9:162752x1536 / 1536x2752

“原生 2K”只说明目标画布,并不自动保证小字正确、物体数量准确或语义细节翻倍。分辨率和提示词遵循是两项不同测试。

编辑侧支持最多 10 张参考图、人物/商品身份保持、圈选或涂画指示、独立 Mask、主体提取和透明图层编辑。生成透明图时,官方建议在提示词中明确写出 RGBA、Alpha 通道和透明背景,并保存为 PNG;JPEG 无法保存透明通道。

Qwen-Image-2.1 显存需求

官方 Hugging Face 文件能解释为什么“7B 等于 24 GB 随便跑”并不成立:

组件序列化体积约为
Qwen3-VL 文本/视觉编码器17.5 GB
DiT Transformer14.2 GB
RGBA VAE1.4 GB
合计33.1 GB

文件体积不等于峰值显存,但官方 BF16 .to("cuda") 示例显然不是舒适的 24 GB 配置。vLLM-Omni 在单张 NVIDIA GB300、1024x1024、40 步上的首发实测如下:

配置峰值显存单图时间
BF1634.0 GB3.28-4.49 秒
DiT FP8,敏感 img_mlp 保留 BF1632.0-32.7 GB3.36-4.71 秒
文本编码器 FP827.5-28.1 GB3.43-4.77 秒

这些是 GB300 数据,不是 RTX 3090/4090 数据,而且输出只有 1024px,不是默认 2048px。FP8 在该测试里主要节省显存,并没有提速。24 GB 显卡可能通过量化、CPU offload、VAE tiling 或社区 ComfyUI 工作流运行,但这是一项优化工程,不能承诺原生 2K 的速度和稳定性。

Diffusers 本地安装

首发文档从 Git 安装 Diffusers。生产评估应使用虚拟环境,并固定已验证的 commit:

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers

最小生成示例沿用官方 QwenImage21Pipeline

python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

多参考图编辑可传入 image=[...]。评测时记录种子、完整提示词、运行时 commit、精度、分辨率和步数,否则不同文章的“画质更好”无法复现。

ComfyUI 支持

ComfyUI 已在首发日提供原生支持以及官方文生图、编辑工作流 JSON,适合可视化试验和社区 offload 方案。Diffusers 更适合可控 Python 评测;vLLM-Omni 和 SGLang 更偏向服务、批处理、缓存与 FP8。不同运行时默认值不一定相同,应显式发送 40 步并核对参考图上限。

Qwen-Image-2.1 可以商用吗?

公开许可证没有授予商用权。 Qwen Research License 把 Non-Commercial 定义为仅用于研究或评估,并只允许在非商业目的下使用、修改和分发材料。

用途公开许可证结论
内部研究或评估按协议条件允许
再分发权重或衍生版本受非商业边界和署名等条件约束
收费产品或商业服务需要另行获得商用许可
商用联系邮箱model-business@notice.qwencloud.com

“可以下载权重”不等于 Apache-2.0,也不等于可自由商用。官方文章使用了“open-source”表述,但真正有法律效力的是受限研究许可。计划销售生成素材或把模型接入付费服务的团队,应先取得书面许可和法律意见。

谁适合用,谁应该等等

适合评估的场景:原生透明素材能省掉抠图步骤;需要多个人物/商品/风格参考;希望一个本地模型同时完成生成与编辑;有 32 GB 以上显卡或愿意投入量化/offload;用途确实是非商业研究评估。

应该暂缓的场景:尚未拿到商用许可;需要开箱即用的 24 GB 原生 2K 部署;复杂指令遵循比 Alpha 通道更重要;需要成熟的独立可靠性或多语言排版数据;或者今天就需要 OmniaKey 托管的 Qwen-Image-2.1 API。

如果需要当前已上线的图片 API,可以参考 Nano Banana 2 与 Pro 实测对比OmniaKey 模型目录才是平台实时可用性的唯一依据。

本次测评的限制

  1. 公开 Demo 繁忙,自定义生成没有完成。
  2. 4 个视觉观察来自官方精选样例,不是盲测或随机种子测试。
  3. 独立对比只有 15 个文生图任务,不测编辑和透明图。
  4. 显存/速度数据来自 GB200/GB300,不是消费级 RTX。
  5. 首发日运行时更新很快,默认值和上限可能变化。
  6. 本文是技术分析,不是法律意见。

常见问题

Qwen-Image-2.1 是开源模型吗?

代码和权重可公开下载,官方也称其为 open-source;但权重使用限制商用的 Qwen Research License。更准确的说法是“开放权重、研究用途许可”,而不是“可自由商用的开源模型”。

Qwen-Image-2.1 需要多少显存?

官方核心文件约 33.1 GB。vLLM-Omni 在 GB300 上测得 BF16 峰值 34.0 GB,文本编码器 FP8 为 27.5-28.1 GB。分辨率、精度、offload、运行时和显卡架构都会改变结果。

RTX 3090 或 4090 能跑 Qwen-Image-2.1 吗?

官方完整 BF16 .to("cuda") 路径放不进 24 GB。通过量化与 offload 可能可以运行,但首发官方证据不能证明消费卡上的速度或原生 2K 稳定性。

Qwen-Image-2.1 支持 ComfyUI 吗?

支持。ComfyUI 在发布当天提供了原生节点以及官方文生图、图像编辑工作流。

最多能用几张参考图?

官方 Diffusers 管线最多 10 张;当前 vLLM-Omni 最多 4 张。部署时应以实际运行时合同为准。

Qwen-Image-2.1 能商用吗?

公开的研究许可证不授予商业使用。商用许可需联系 model-business@notice.qwencloud.com,并针对实际用途咨询法律意见。

OmniaKey 支持 Qwen-Image-2.1 吗?

截至 2026 年 9 月 21 日不支持。OmniaKey 当前图片目录列出 Qwen Image 3 路线,没有 Qwen/Qwen-Image-2.1。本文不构成上线公告。

主要来源

证据核查时间为 2026-09-21。运行时、限制和许可选项可能变化,生产决策前请重新打开一手来源。