Модель Jev интегрирована и уже доступна · Добро пожаловать
Блог
Гайд

Обзор Qwen-Image-2.1

Нативный RGBA и редактирование по нескольким референсам действительно выделяются, но исследовательская лицензия и практический минимум около 28-34 ГБ памяти делают модель объектом оценки, а не коммерческим вариантом по умолчанию.

14 мин чтенияOmniaKey
Qwen-Image-2.1генерация изображенийредактирование изображенийComfyUIVRAM

Этот обзор Qwen-Image-2.1 показывает интересную модель с открытыми весами и двумя редкими преимуществами: нативным RGBA и единым пайплайном для генерации и редактирования. Но есть и два жестких ограничения: публичные веса распространяются по некоммерческой исследовательской лицензии, а основные файлы занимают около 33.1 ГБ еще до накладных расходов инференса.

Модель стоит оценить для прозрачных товарных изображений, стикеров, выделения объектов и композиций по нескольким референсам. Для коммерческого сервиса или простой установки на 24 ГБ она пока не является очевидным выбором.

Проверено 21 сентября 2026 года. Мы изучили официальный анонс, репозиторий, файлы Hugging Face, лицензию, инструкции Diffusers/ComfyUI, рецепт vLLM-Omni, график Qwen и независимый GenAI Image Showdown. Также были загружены четыре официальных примера. Собственная генерация в публичном Hugging Face Demo не завершилась из-за загрузки Space, поэтому это обзор запуска на основе доказательств, а не заявленный собственный бенчмарк. Официальная галерея содержит отобранные разработчиком примеры.

Qwen-Image-2.1: краткий вывод обзора

ВопросПроверенный ответ
Что этоЕдиная модель text-to-image и редактирования Qwen/Qwen-Image-2.1
АрхитектураВизуальный генератор 7B, 32 слоя Single-Stream DiT, энкодер Qwen3-VL 8B
РазрешениеНативное 2K; по умолчанию Diffusers использует 2048x2048
ПрозрачностьНативная генерация и обработка четырехканального RGBA
РеференсыДо 10 в официальном пайплайне; 4 в текущем vLLM-Omni
Семплирование40 шагов в официальном примере Diffusers
Локальный объемОколо 33.1 ГБ для энкодера, Transformer и VAE без overhead
ЛицензияQwen Research License, только некоммерческие исследования/оценка
OmniaKeyНет в каталоге на 2026-09-21

Главная причина протестировать модель — не место в рейтинге, а сочетание настоящего альфа-канала, десяти референсов и локального редактирования. Лицензия, память и малое число независимых проверок не позволяют безоговорочно отправлять ее в продакшен.

Что такое Qwen-Image-2.1

Qwen выпустила Qwen-Image-2.1 20 сентября 2026 года. Генерация по тексту, редактирование одного изображения, композиция по нескольким референсам, маски, нарисованные указания и прозрачное выделение объекта используют один пайплайн.

Обозначение 7B относится только к визуальному генератору, а не ко всему загружаемому стеку:

  • визуальный генератор 7B и 32 слоя Single-Stream DiT;
  • Qwen3-VL 8B для текста и изображений-референсов;
  • VAE с 64 латентными каналами, сжатием пространства 16x и четырьмя каналами ввода/вывода;
  • RGB, RGBA, генерация и редактирование в одной модели.

В день релиза поддержку объявили Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang и LightX2V. Ограничения зависят от среды: официальный Diffusers допускает десять референсов, а текущий vLLM-Omni отклоняет пятое изображение.

Что видно в официальных примерах

Мы проверили оригинальные файлы, а не только миниатюры. Постер правильно воспроизвел обе заданные строки на английском и сохранил понятную типографическую иерархию. Сториборд содержал ровно шесть кадров и узнаваемого маленького робота. На товарном изображении убедительно выглядели преломление стекла и блики.

Прозрачный пример — RGBA PNG размером 1664x2496 с альфа-значениями от 0 до 255. Это реальные прозрачные и непрозрачные пиксели, а не нарисованная шахматная подложка внутри RGB. Именно эта возможность сильнее всего отличает релиз.

Все это отобранные официальные примеры, а не слепой тест. Из-за исследовательской лицензии мы не перепубликуем их, а даем ссылку на галерею и фиксируем проверяемые свойства.

Бенчмарки Qwen-Image-2.1

На графике Qwen модель набрала 60.28 в Qwen-Image-Bench. Это полезное свидетельство поставщика, но не независимый рейтинг: сам бенчмарк, агрегация и оценка принадлежат издателю модели.

Независимый GenAI Image Showdown использует 15 сложных заданий на следование промпту, разрешает адаптировать промпт под модель и запрещает редактирование и inpainting.

МодельПройдено заданийCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
Исходная Qwen-Image4 / 1568%

Версия 2.1 поднялась с 4 до 7 пройденных задач, хотя отдельная метрика compliance изменилась с 68% до 67%. Противоречия нет: показатели измеряют разное. В этой небольшой проверке 2.1 лучше исходной модели, но не лидирует в сложном следовании инструкциям.

Официальные 60.28 и независимые 7 / 15 нельзя объединить в одну таблицу: наборы заданий и методы оценки различаются.

Нативные 2K, RGBA и редактирование

Diffusers по умолчанию использует 2048x2048 и 40 шагов. Qwen также рекомендует 2400x1792 для 4:3, 1792x2400 для 3:4, 2752x1536 для 16:9 и 1536x2752 для 9:16.

«Нативные 2K» описывают рабочий холст, но не гарантируют идеальный мелкий текст, точное количество объектов или больше смысловых деталей. Разрешение и следование промпту нужно проверять отдельно.

Редактирование поддерживает до десяти референсов в Diffusers, сохранение идентичности людей и товаров, круги и нарисованные подсказки, отдельные маски, выделение объектов и прозрачные слои. Для RGBA Qwen советует явно запросить альфа-канал и прозрачный фон и сохранять PNG. JPEG альфа-канал не сохраняет.

Требования Qwen-Image-2.1 к VRAM

КомпонентПримерный размер файлов
Текстово-визуальный энкодер Qwen3-VL17.5 ГБ
DiT Transformer14.2 ГБ
RGBA VAE1.4 ГБ
Итого33.1 ГБ

Размер файлов не равен пиковой VRAM, но официальный BF16-путь .to("cuda") не является комфортной конфигурацией на 24 ГБ. vLLM-Omni измерил на одной NVIDIA GB300 при 1024x1024 и 40 шагах:

КонфигурацияПиковая памятьВремя на изображение
BF1634.0 ГБ3.28-4.49 с
DiT FP8, чувствительный img_mlp в BF1632.0-32.7 ГБ3.36-4.71 с
Текстовый энкодер FP827.5-28.1 ГБ3.43-4.77 с

Это измерения GB300 при 1024px, а не RTX 3090/4090 и не стандартные 2K. FP8 в этом тесте экономил память, но не ускорял генерацию. 24 ГБ могут работать с квантизацией, CPU offload, VAE tiling или сообществом ComfyUI, но это проект оптимизации, а не гарантированная базовая установка.

Локальная установка через Diffusers

Официальный quick start устанавливает Diffusers из Git. Для воспроизводимости используйте виртуальное окружение и закрепите проверенный commit.

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

Несколько референсов передаются как image=[...]. Записывайте seed, полный промпт, commit среды, точность, разрешение и число шагов — иначе сравнение качества невоспроизводимо.

ComfyUI и серверные среды

ComfyUI получил нативную поддержку и официальные JSON-workflow для генерации и редактирования. Он удобен для визуальных экспериментов и offload-схем сообщества. Diffusers прозрачнее для контролируемой Python-оценки; vLLM-Omni и SGLang рассчитаны на serving, batching, cache и FP8. Явно задавайте 40 шагов и проверяйте лимит референсов конкретной среды.

Лицензия и коммерческое использование

Публичная лицензия не предоставляет коммерческих прав. Qwen Research License определяет Non-Commercial как исследования или оценку и разрешает использование, изменение и распространение материалов только для некоммерческих целей.

СценарийПозиция опубликованной лицензии
Внутреннее исследование/оценкаРазрешено на условиях соглашения
Распространение весов или производныхТолько в некоммерческих границах и с уведомлениями
Платный продукт или коммерческий сервисНужна отдельная коммерческая лицензия
Контактmodel-business@notice.qwencloud.com

Возможность скачать веса не означает Apache-2.0 или свободный коммерческий open source. Если планируется продажа изображений или платный сервис, получите письменные условия и юридическую консультацию, а не выводите права из слова «open-source» в анонсе.

Кому модель подходит

Оценка оправдана, если нативная прозрачность убирает этап удаления фона, нужны несколько людей или товаров-референсов, одна локальная модель должна генерировать и редактировать, доступно больше 32 ГБ либо приемлемы квантизация/offload, а задача действительно некоммерческая.

Лучше подождать без коммерческой лицензии, при обязательном plug-and-play 2K на 24 ГБ, при высшем приоритете точного следования промпту, необходимости зрелых данных по многоязычной типографике или управляемого Qwen-Image-2.1 API в OmniaKey уже сегодня.

Для доступного сейчас API изображений изучите сравнение Nano Banana 2 и Pro. Актуальность маршрутов OmniaKey определяет каталог моделей.

Ограничения обзора

Собственная генерация не завершилась из-за загрузки Demo. Визуальные наблюдения основаны на четырех отобранных официальных примерах. Независимый тест содержит лишь 15 задач text-to-image и не измеряет редактирование или прозрачность. Данные оборудования относятся к GB200/GB300, а не потребительским RTX. Это технический анализ, не юридическая консультация.

Частые вопросы

Qwen-Image-2.1 — open source?

Код и веса доступны публично, а Qwen использует термин open-source. Однако веса распространяются по исследовательской лицензии с ограничением коммерции. Точнее говорить «открытые веса с исследовательской лицензией».

Сколько VRAM требуется Qwen-Image-2.1?

Основные файлы занимают около 33.1 ГБ. vLLM-Omni измерил 34.0 ГБ в BF16 и 27.5-28.1 ГБ с FP8 для текстового энкодера на GB300. Результат зависит от разрешения, точности, offload, runtime и GPU.

Работает ли модель на RTX 3090 или 4090?

Не по полному официальному BF16-пути .to("cuda"). Квантизация и offload могут позволить 24 ГБ, но официальные данные релиза не подтверждают скорость или стабильность нативных 2K на этих картах.

Есть ли поддержка ComfyUI?

Да. В день релиза появились нативная поддержка и официальные workflow генерации и редактирования.

Сколько референсов поддерживается?

Официальный Diffusers — до 10, текущий vLLM-Omni — 4. Проверяйте контракт фактически развернутой среды.

Разрешено ли коммерческое использование?

Опубликованная Qwen Research License его не разрешает. Запросите отдельную лицензию по адресу model-business@notice.qwencloud.com и проверьте свой сценарий с юристом.

Доступен ли Qwen-Image-2.1 в OmniaKey?

Нет на 21 сентября 2026 года. В каталоге есть маршруты Qwen Image 3, но нет Qwen/Qwen-Image-2.1. Этот обзор не является анонсом доступности.

Первичные источники

Данные проверены 2026-09-21. Среды, лимиты и варианты лицензирования могут измениться; перед production-решением снова откройте первичные источники.