Обзор Qwen-Image-2.1
Нативный RGBA и редактирование по нескольким референсам действительно выделяются, но исследовательская лицензия и практический минимум около 28-34 ГБ памяти делают модель объектом оценки, а не коммерческим вариантом по умолчанию.
Этот обзор Qwen-Image-2.1 показывает интересную модель с открытыми весами и двумя редкими преимуществами: нативным RGBA и единым пайплайном для генерации и редактирования. Но есть и два жестких ограничения: публичные веса распространяются по некоммерческой исследовательской лицензии, а основные файлы занимают около 33.1 ГБ еще до накладных расходов инференса.
Модель стоит оценить для прозрачных товарных изображений, стикеров, выделения объектов и композиций по нескольким референсам. Для коммерческого сервиса или простой установки на 24 ГБ она пока не является очевидным выбором.
Проверено 21 сентября 2026 года. Мы изучили официальный анонс, репозиторий, файлы Hugging Face, лицензию, инструкции Diffusers/ComfyUI, рецепт vLLM-Omni, график Qwen и независимый GenAI Image Showdown. Также были загружены четыре официальных примера. Собственная генерация в публичном Hugging Face Demo не завершилась из-за загрузки Space, поэтому это обзор запуска на основе доказательств, а не заявленный собственный бенчмарк. Официальная галерея содержит отобранные разработчиком примеры.
Qwen-Image-2.1: краткий вывод обзора
| Вопрос | Проверенный ответ |
|---|---|
| Что это | Единая модель text-to-image и редактирования Qwen/Qwen-Image-2.1 |
| Архитектура | Визуальный генератор 7B, 32 слоя Single-Stream DiT, энкодер Qwen3-VL 8B |
| Разрешение | Нативное 2K; по умолчанию Diffusers использует 2048x2048 |
| Прозрачность | Нативная генерация и обработка четырехканального RGBA |
| Референсы | До 10 в официальном пайплайне; 4 в текущем vLLM-Omni |
| Семплирование | 40 шагов в официальном примере Diffusers |
| Локальный объем | Около 33.1 ГБ для энкодера, Transformer и VAE без overhead |
| Лицензия | Qwen Research License, только некоммерческие исследования/оценка |
| OmniaKey | Нет в каталоге на 2026-09-21 |
Главная причина протестировать модель — не место в рейтинге, а сочетание настоящего альфа-канала, десяти референсов и локального редактирования. Лицензия, память и малое число независимых проверок не позволяют безоговорочно отправлять ее в продакшен.
Что такое Qwen-Image-2.1
Qwen выпустила Qwen-Image-2.1 20 сентября 2026 года. Генерация по тексту, редактирование одного изображения, композиция по нескольким референсам, маски, нарисованные указания и прозрачное выделение объекта используют один пайплайн.
Обозначение 7B относится только к визуальному генератору, а не ко всему загружаемому стеку:
- визуальный генератор 7B и 32 слоя Single-Stream DiT;
- Qwen3-VL 8B для текста и изображений-референсов;
- VAE с 64 латентными каналами, сжатием пространства 16x и четырьмя каналами ввода/вывода;
- RGB, RGBA, генерация и редактирование в одной модели.
В день релиза поддержку объявили Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang и LightX2V. Ограничения зависят от среды: официальный Diffusers допускает десять референсов, а текущий vLLM-Omni отклоняет пятое изображение.
Что видно в официальных примерах
Мы проверили оригинальные файлы, а не только миниатюры. Постер правильно воспроизвел обе заданные строки на английском и сохранил понятную типографическую иерархию. Сториборд содержал ровно шесть кадров и узнаваемого маленького робота. На товарном изображении убедительно выглядели преломление стекла и блики.
Прозрачный пример — RGBA PNG размером 1664x2496 с альфа-значениями от 0 до 255. Это реальные прозрачные и непрозрачные пиксели, а не нарисованная шахматная подложка внутри RGB. Именно эта возможность сильнее всего отличает релиз.
Все это отобранные официальные примеры, а не слепой тест. Из-за исследовательской лицензии мы не перепубликуем их, а даем ссылку на галерею и фиксируем проверяемые свойства.
Бенчмарки Qwen-Image-2.1
На графике Qwen модель набрала 60.28 в Qwen-Image-Bench. Это полезное свидетельство поставщика, но не независимый рейтинг: сам бенчмарк, агрегация и оценка принадлежат издателю модели.
Независимый GenAI Image Showdown использует 15 сложных заданий на следование промпту, разрешает адаптировать промпт под модель и запрещает редактирование и inpainting.
| Модель | Пройдено заданий | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| Исходная Qwen-Image | 4 / 15 | 68% |
Версия 2.1 поднялась с 4 до 7 пройденных задач, хотя отдельная метрика compliance изменилась с 68% до 67%. Противоречия нет: показатели измеряют разное. В этой небольшой проверке 2.1 лучше исходной модели, но не лидирует в сложном следовании инструкциям.
Официальные 60.28 и независимые 7 / 15 нельзя объединить в одну таблицу: наборы заданий и методы оценки различаются.
Нативные 2K, RGBA и редактирование
Diffusers по умолчанию использует 2048x2048 и 40 шагов. Qwen также рекомендует 2400x1792 для 4:3, 1792x2400 для 3:4, 2752x1536 для 16:9 и 1536x2752 для 9:16.
«Нативные 2K» описывают рабочий холст, но не гарантируют идеальный мелкий текст, точное количество объектов или больше смысловых деталей. Разрешение и следование промпту нужно проверять отдельно.
Редактирование поддерживает до десяти референсов в Diffusers, сохранение идентичности людей и товаров, круги и нарисованные подсказки, отдельные маски, выделение объектов и прозрачные слои. Для RGBA Qwen советует явно запросить альфа-канал и прозрачный фон и сохранять PNG. JPEG альфа-канал не сохраняет.
Требования Qwen-Image-2.1 к VRAM
| Компонент | Примерный размер файлов |
|---|---|
| Текстово-визуальный энкодер Qwen3-VL | 17.5 ГБ |
| DiT Transformer | 14.2 ГБ |
| RGBA VAE | 1.4 ГБ |
| Итого | 33.1 ГБ |
Размер файлов не равен пиковой VRAM, но официальный BF16-путь .to("cuda") не является комфортной конфигурацией на 24 ГБ. vLLM-Omni измерил на одной NVIDIA GB300 при 1024x1024 и 40 шагах:
| Конфигурация | Пиковая память | Время на изображение |
|---|---|---|
| BF16 | 34.0 ГБ | 3.28-4.49 с |
DiT FP8, чувствительный img_mlp в BF16 | 32.0-32.7 ГБ | 3.36-4.71 с |
| Текстовый энкодер FP8 | 27.5-28.1 ГБ | 3.43-4.77 с |
Это измерения GB300 при 1024px, а не RTX 3090/4090 и не стандартные 2K. FP8 в этом тесте экономил память, но не ускорял генерацию. 24 ГБ могут работать с квантизацией, CPU offload, VAE tiling или сообществом ComfyUI, но это проект оптимизации, а не гарантированная базовая установка.
Локальная установка через Diffusers
Официальный quick start устанавливает Diffusers из Git. Для воспроизводимости используйте виртуальное окружение и закрепите проверенный commit.
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
Несколько референсов передаются как image=[...]. Записывайте seed, полный промпт, commit среды, точность, разрешение и число шагов — иначе сравнение качества невоспроизводимо.
ComfyUI и серверные среды
ComfyUI получил нативную поддержку и официальные JSON-workflow для генерации и редактирования. Он удобен для визуальных экспериментов и offload-схем сообщества. Diffusers прозрачнее для контролируемой Python-оценки; vLLM-Omni и SGLang рассчитаны на serving, batching, cache и FP8. Явно задавайте 40 шагов и проверяйте лимит референсов конкретной среды.
Лицензия и коммерческое использование
Публичная лицензия не предоставляет коммерческих прав. Qwen Research License определяет Non-Commercial как исследования или оценку и разрешает использование, изменение и распространение материалов только для некоммерческих целей.
| Сценарий | Позиция опубликованной лицензии |
|---|---|
| Внутреннее исследование/оценка | Разрешено на условиях соглашения |
| Распространение весов или производных | Только в некоммерческих границах и с уведомлениями |
| Платный продукт или коммерческий сервис | Нужна отдельная коммерческая лицензия |
| Контакт | model-business@notice.qwencloud.com |
Возможность скачать веса не означает Apache-2.0 или свободный коммерческий open source. Если планируется продажа изображений или платный сервис, получите письменные условия и юридическую консультацию, а не выводите права из слова «open-source» в анонсе.
Кому модель подходит
Оценка оправдана, если нативная прозрачность убирает этап удаления фона, нужны несколько людей или товаров-референсов, одна локальная модель должна генерировать и редактировать, доступно больше 32 ГБ либо приемлемы квантизация/offload, а задача действительно некоммерческая.
Лучше подождать без коммерческой лицензии, при обязательном plug-and-play 2K на 24 ГБ, при высшем приоритете точного следования промпту, необходимости зрелых данных по многоязычной типографике или управляемого Qwen-Image-2.1 API в OmniaKey уже сегодня.
Для доступного сейчас API изображений изучите сравнение Nano Banana 2 и Pro. Актуальность маршрутов OmniaKey определяет каталог моделей.
Ограничения обзора
Собственная генерация не завершилась из-за загрузки Demo. Визуальные наблюдения основаны на четырех отобранных официальных примерах. Независимый тест содержит лишь 15 задач text-to-image и не измеряет редактирование или прозрачность. Данные оборудования относятся к GB200/GB300, а не потребительским RTX. Это технический анализ, не юридическая консультация.
Частые вопросы
Qwen-Image-2.1 — open source?
Код и веса доступны публично, а Qwen использует термин open-source. Однако веса распространяются по исследовательской лицензии с ограничением коммерции. Точнее говорить «открытые веса с исследовательской лицензией».
Сколько VRAM требуется Qwen-Image-2.1?
Основные файлы занимают около 33.1 ГБ. vLLM-Omni измерил 34.0 ГБ в BF16 и 27.5-28.1 ГБ с FP8 для текстового энкодера на GB300. Результат зависит от разрешения, точности, offload, runtime и GPU.
Работает ли модель на RTX 3090 или 4090?
Не по полному официальному BF16-пути .to("cuda"). Квантизация и offload могут позволить 24 ГБ, но официальные данные релиза не подтверждают скорость или стабильность нативных 2K на этих картах.
Есть ли поддержка ComfyUI?
Да. В день релиза появились нативная поддержка и официальные workflow генерации и редактирования.
Сколько референсов поддерживается?
Официальный Diffusers — до 10, текущий vLLM-Omni — 4. Проверяйте контракт фактически развернутой среды.
Разрешено ли коммерческое использование?
Опубликованная Qwen Research License его не разрешает. Запросите отдельную лицензию по адресу model-business@notice.qwencloud.com и проверьте свой сценарий с юристом.
Доступен ли Qwen-Image-2.1 в OmniaKey?
Нет на 21 сентября 2026 года. В каталоге есть маршруты Qwen Image 3, но нет Qwen/Qwen-Image-2.1. Этот обзор не является анонсом доступности.
Первичные источники
- Официальный анонс Qwen
- Репозиторий и quick start
- Qwen Research License
- Файлы Hugging Face
- ComfyUI text-to-image workflow
- ComfyUI workflow редактирования
- Рецепт vLLM-Omni
- Qwen-Image-Bench
- Независимый GenAI Image Showdown
Данные проверены 2026-09-21. Среды, лимиты и варианты лицензирования могут измениться; перед production-решением снова откройте первичные источники.