Qwen-Image-2.1 测评
Qwen-Image-2.1 的原生透明图和多参考图编辑很有辨识度,但研究用途许可与约 28-34 GB 的实际显存门槛,决定了它更适合评估,而不是直接成为商业生产默认模型。
这篇 Qwen-Image-2.1 测评 的结论很明确:它是一款技术上很有意思的开放权重 7B 生图模型,原生 RGBA 透明图和统一的生成/编辑管线是最突出的优势;但它不是可以无条件商用的“开源模型”,完整权重约 33.1 GB,也不能简单说成“RTX 3090 轻松运行”。
如果你要研究透明商品素材、贴纸、抠图或多参考图合成,它值得测试。如果你要直接放进收费产品,则应先解决独立商用许可和部署硬件问题。
事实核查于 2026 年 9 月 21 日。 我们核对了官方发布文章、仓库、Hugging Face 文件、许可证、Diffusers/ComfyUI 文档、vLLM-Omni 实测、Qwen 官方基准图和独立 GenAI Image Showdown;还下载检查了 4 个官方原始样例。公开 Hugging Face Demo 当时繁忙,自定义生成没有完成,因此本文是基于证据的首发评测,不冒充第一手大样本实测。官方画廊属于厂商精选样例。
Qwen-Image-2.1 测评:先看结论
| 问题 | 核实结果 |
|---|---|
| 模型是什么 | 文生图与图像编辑统一模型,ID 为 Qwen/Qwen-Image-2.1 |
| 核心架构 | 7B 视觉生成器、32 层 Single-Stream DiT、Qwen3-VL 8B 编码器 |
| 分辨率 | 原生 2K;官方 Diffusers 默认 2048x2048 |
| 透明图 | 原生四通道 RGBA 生成与编辑 |
| 参考图数量 | 官方管线最多 10 张;当前 vLLM-Omni 实现最多 4 张 |
| 默认采样 | 官方 Diffusers 示例为 40 步 |
| 本地体积 | 编码器、Transformer 与 VAE 权重约 33.1 GB,尚未计运行开销 |
| 商用许可 | Qwen Research License,仅授予非商业研究/评估用途 |
| OmniaKey 可用性 | 截至 2026-09-21 未进入 OmniaKey 模型目录 |
最值得测的不是榜单名次,而是 真 Alpha 透明通道 + 10 张参考图 + 局部编辑 这一组能力。最不能忽略的也不是画质,而是许可证、显存和目前仍有限的独立评测。
Qwen-Image-2.1 是什么模型?
Qwen 于 2026 年 9 月 20 日发布 Qwen-Image-2.1。它用同一套管线完成文生图、单图编辑、多图合成、遮罩编辑和透明素材提取,不需要另载一个编辑模型。
“7B”只指视觉生成部分,并不代表整个推理管线只有 7B:
- 视觉生成器有 7B 参数和 32 层 Single-Stream DiT;
- 提示词与参考图由 Qwen3-VL 8B 文本/视觉编码器共同处理;
- VAE 使用 64 通道潜空间、16 倍空间压缩和四通道输入输出;
- RGBA、普通 RGB、生成和编辑共用一套模型。
首发当天,Diffusers 的 QwenImage21Pipeline、ComfyUI、vLLM-Omni、SGLang 和 LightX2V 都给出了支持。不过“模型最多 10 张参考图”不等于每个运行时都支持 10 张:当前 vLLM-Omni 会拒绝第 5 张条件图。
官方样例实际说明了什么
我们直接检查了官方原始文件,而不是只看网页缩略图。
英文排版
官方海报样例正确生成了提示词要求的两行英文,字形、层级和间距足以成为可继续修改的候选图。但一个精选英文海报不能证明多语言文字在不同种子下都稳定。
六格分镜
分镜图恰好有 6 格,小机器人在各格中保持了可辨认的一致性。它说明模型能处理“固定格数 + 角色连续性”,但仍需要用重复种子和真实剧本检验细节连贯性。
商品材质
玻璃商品样例的折射、高光和材质分层很有说服力,符合官方对真实纹理的描述。它仍然是厂商挑选的发布图,不是盲测。
不是棋盘格伪装的真透明 PNG
下载的透明样例是一张 1664x2496 的 RGBA PNG,Alpha 通道最小值为 0、最大值为 255,确实同时包含全透明和不透明像素。这是 2.1 最清晰的差异化能力。
本文不直接转载这些图片。权重和发布资产采用研究用途许可,因此我们链接官方画廊并报告可复查的文件属性。
Qwen-Image-2.1 跑分怎么看
Qwen 官方发布图给 Qwen-Image-2.1 的 Qwen-Image-Bench 总分为 60.28。这个成绩说明它在官方评测框架内竞争力很强,但基准、聚合方式与评测流程都来自模型发布方,不能当成独立排名。
独立的 GenAI Image Showdown 给出了更小、也更克制的结果。它包含 15 个高难度提示词遵循任务,允许针对模型调提示词,但禁止补绘与二次编辑。
| 模型 | 通过任务 | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| 初代 Qwen-Image | 4 / 15 | 68% |
2.1 的通过数从 4 提升到 7,而单独计算的 compliance 从 68% 变成 67%。两项指标衡量方式不同,并不矛盾。合理结论是:2.1 在这个小样本里明显优于初代,但复杂指令遵循仍落后于最强闭源模型。
官方 60.28 和第三方 7 / 15 不能合并成一张总榜,它们不是同一批任务,也不是同一种计分方法。
原生 2K、RGBA 与多参考图编辑
官方 Diffusers 默认分辨率为 2048x2048,默认去噪 40 步。推荐尺寸包括:
| 比例 | 推荐尺寸 |
|---|---|
| 1:1 | 2048x2048 |
| 4:3 / 3:4 | 2400x1792 / 1792x2400 |
| 3:2 / 2:3 | 2528x1696 / 1696x2528 |
| 16:9 / 9:16 | 2752x1536 / 1536x2752 |
“原生 2K”只说明目标画布,并不自动保证小字正确、物体数量准确或语义细节翻倍。分辨率和提示词遵循是两项不同测试。
编辑侧支持最多 10 张参考图、人物/商品身份保持、圈选或涂画指示、独立 Mask、主体提取和透明图层编辑。生成透明图时,官方建议在提示词中明确写出 RGBA、Alpha 通道和透明背景,并保存为 PNG;JPEG 无法保存透明通道。
Qwen-Image-2.1 显存需求
官方 Hugging Face 文件能解释为什么“7B 等于 24 GB 随便跑”并不成立:
| 组件 | 序列化体积约为 |
|---|---|
| Qwen3-VL 文本/视觉编码器 | 17.5 GB |
| DiT Transformer | 14.2 GB |
| RGBA VAE | 1.4 GB |
| 合计 | 33.1 GB |
文件体积不等于峰值显存,但官方 BF16 .to("cuda") 示例显然不是舒适的 24 GB 配置。vLLM-Omni 在单张 NVIDIA GB300、1024x1024、40 步上的首发实测如下:
| 配置 | 峰值显存 | 单图时间 |
|---|---|---|
| BF16 | 34.0 GB | 3.28-4.49 秒 |
DiT FP8,敏感 img_mlp 保留 BF16 | 32.0-32.7 GB | 3.36-4.71 秒 |
| 文本编码器 FP8 | 27.5-28.1 GB | 3.43-4.77 秒 |
这些是 GB300 数据,不是 RTX 3090/4090 数据,而且输出只有 1024px,不是默认 2048px。FP8 在该测试里主要节省显存,并没有提速。24 GB 显卡可能通过量化、CPU offload、VAE tiling 或社区 ComfyUI 工作流运行,但这是一项优化工程,不能承诺原生 2K 的速度和稳定性。
Diffusers 本地安装
首发文档从 Git 安装 Diffusers。生产评估应使用虚拟环境,并固定已验证的 commit:
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
最小生成示例沿用官方 QwenImage21Pipeline:
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
多参考图编辑可传入 image=[...]。评测时记录种子、完整提示词、运行时 commit、精度、分辨率和步数,否则不同文章的“画质更好”无法复现。
ComfyUI 支持
ComfyUI 已在首发日提供原生支持以及官方文生图、编辑工作流 JSON,适合可视化试验和社区 offload 方案。Diffusers 更适合可控 Python 评测;vLLM-Omni 和 SGLang 更偏向服务、批处理、缓存与 FP8。不同运行时默认值不一定相同,应显式发送 40 步并核对参考图上限。
Qwen-Image-2.1 可以商用吗?
公开许可证没有授予商用权。 Qwen Research License 把 Non-Commercial 定义为仅用于研究或评估,并只允许在非商业目的下使用、修改和分发材料。
| 用途 | 公开许可证结论 |
|---|---|
| 内部研究或评估 | 按协议条件允许 |
| 再分发权重或衍生版本 | 受非商业边界和署名等条件约束 |
| 收费产品或商业服务 | 需要另行获得商用许可 |
| 商用联系邮箱 | model-business@notice.qwencloud.com |
“可以下载权重”不等于 Apache-2.0,也不等于可自由商用。官方文章使用了“open-source”表述,但真正有法律效力的是受限研究许可。计划销售生成素材或把模型接入付费服务的团队,应先取得书面许可和法律意见。
谁适合用,谁应该等等
适合评估的场景:原生透明素材能省掉抠图步骤;需要多个人物/商品/风格参考;希望一个本地模型同时完成生成与编辑;有 32 GB 以上显卡或愿意投入量化/offload;用途确实是非商业研究评估。
应该暂缓的场景:尚未拿到商用许可;需要开箱即用的 24 GB 原生 2K 部署;复杂指令遵循比 Alpha 通道更重要;需要成熟的独立可靠性或多语言排版数据;或者今天就需要 OmniaKey 托管的 Qwen-Image-2.1 API。
如果需要当前已上线的图片 API,可以参考 Nano Banana 2 与 Pro 实测对比。OmniaKey 模型目录才是平台实时可用性的唯一依据。
本次测评的限制
- 公开 Demo 繁忙,自定义生成没有完成。
- 4 个视觉观察来自官方精选样例,不是盲测或随机种子测试。
- 独立对比只有 15 个文生图任务,不测编辑和透明图。
- 显存/速度数据来自 GB200/GB300,不是消费级 RTX。
- 首发日运行时更新很快,默认值和上限可能变化。
- 本文是技术分析,不是法律意见。
常见问题
Qwen-Image-2.1 是开源模型吗?
代码和权重可公开下载,官方也称其为 open-source;但权重使用限制商用的 Qwen Research License。更准确的说法是“开放权重、研究用途许可”,而不是“可自由商用的开源模型”。
Qwen-Image-2.1 需要多少显存?
官方核心文件约 33.1 GB。vLLM-Omni 在 GB300 上测得 BF16 峰值 34.0 GB,文本编码器 FP8 为 27.5-28.1 GB。分辨率、精度、offload、运行时和显卡架构都会改变结果。
RTX 3090 或 4090 能跑 Qwen-Image-2.1 吗?
官方完整 BF16 .to("cuda") 路径放不进 24 GB。通过量化与 offload 可能可以运行,但首发官方证据不能证明消费卡上的速度或原生 2K 稳定性。
Qwen-Image-2.1 支持 ComfyUI 吗?
支持。ComfyUI 在发布当天提供了原生节点以及官方文生图、图像编辑工作流。
最多能用几张参考图?
官方 Diffusers 管线最多 10 张;当前 vLLM-Omni 最多 4 张。部署时应以实际运行时合同为准。
Qwen-Image-2.1 能商用吗?
公开的研究许可证不授予商业使用。商用许可需联系 model-business@notice.qwencloud.com,并针对实际用途咨询法律意见。
OmniaKey 支持 Qwen-Image-2.1 吗?
截至 2026 年 9 月 21 日不支持。OmniaKey 当前图片目录列出 Qwen Image 3 路线,没有 Qwen/Qwen-Image-2.1。本文不构成上线公告。
主要来源
- Qwen 官方发布文章
- Qwen-Image-2.1 官方仓库与快速开始
- Qwen Research License 原文
- Hugging Face 模型文件
- ComfyUI 文生图工作流
- ComfyUI 图像编辑工作流
- vLLM-Omni Qwen-Image-2.1 实测
- Qwen-Image-Bench 仓库
- 独立 GenAI Image Showdown
证据核查时间为 2026-09-21。运行时、限制和许可选项可能变化,生产决策前请重新打开一手来源。