El modelo Jev ya está integrado y disponible · Te damos la bienvenida
Blog
Guía

Análisis de Qwen-Image-2.1

El RGBA nativo y la edición con varias referencias destacan, pero la licencia solo para investigación y un mínimo práctico de unos 28-34 GB lo convierten en un modelo para evaluar, no en una opción comercial predeterminada.

14 min de lecturaOmniaKey
Qwen-Image-2.1generación de imágenesedición de imágenesComfyUIVRAM

Este Qwen-Image-2.1 análisis encuentra un modelo de pesos abiertos muy interesante por dos motivos poco habituales: salida RGBA nativa y una sola canalización para generar y editar. También encuentra dos límites decisivos: los pesos públicos tienen una licencia de investigación no comercial y sus archivos principales ocupan unos 33.1 GB antes de sumar la memoria de ejecución.

Merece una evaluación para recursos transparentes, pegatinas, extracción de sujetos y composiciones con varias referencias. No es todavía la opción más sencilla para un producto de imágenes comercial ni para una GPU de 24 GB sin optimización.

Comprobado el 21 de septiembre de 2026. Revisamos el anuncio, repositorio, archivos de Hugging Face, licencia, instrucciones de Diffusers y ComfyUI, receta de vLLM-Omni, gráfico oficial de Qwen y GenAI Image Showdown. También descargamos cuatro muestras oficiales. La generación propia en el Demo público no terminó porque el Space estaba ocupado; por eso este es un análisis de lanzamiento basado en evidencias, no un benchmark propio. La galería oficial contiene muestras seleccionadas por el proveedor.

Qwen-Image-2.1 análisis: respuesta rápida

PreguntaRespuesta verificada
Qué esModelo unificado de texto a imagen y edición, ID Qwen/Qwen-Image-2.1
ArquitecturaGenerador visual 7B, 32 capas Single-Stream DiT y codificador Qwen3-VL 8B
Resolución2K nativo; Diffusers usa 2048x2048 por defecto
TransparenciaGeneración y edición RGBA de cuatro canales
Imágenes de referenciaHasta 10 en la canalización oficial; 4 en vLLM-Omni actual
Muestreo40 pasos en el ejemplo oficial de Diffusers
Huella localUnos 33.1 GB en codificador, Transformer y VAE, antes del overhead
LicenciaQwen Research License, solo investigación/evaluación no comercial
OmniaKeyNo figura en el catálogo a 2026-09-21

La razón principal para probarlo no es una posición en una tabla, sino la combinación de alfa real, diez referencias y edición local. Las razones para no desplegarlo sin más son igualmente concretas: licencia, memoria y poca evaluación independiente.

Qué es Qwen-Image-2.1

Qwen publicó Qwen-Image-2.1 el 20 de septiembre de 2026. Texto a imagen, edición de una imagen, composición multirreferencia, máscaras, anotaciones pintadas y extracción transparente pasan por la misma canalización.

La etiqueta 7B solo describe el generador visual, no todo lo que se carga:

  • generador visual de 7B parámetros y 32 capas Single-Stream DiT;
  • codificador Qwen3-VL 8B para texto e imágenes de referencia;
  • VAE de 64 canales latentes, compresión espacial 16x y entrada/salida de cuatro canales;
  • tareas RGB, RGBA, generación y edición en el mismo modelo.

Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang y LightX2V anunciaron soporte desde el primer día. Los límites dependen del runtime: Diffusers documenta diez referencias, pero vLLM-Omni rechaza una quinta imagen.

Qué muestran las muestras oficiales

Inspeccionamos los archivos originales, no solo las miniaturas. El póster escribió correctamente las dos líneas inglesas solicitadas y mantuvo una jerarquía tipográfica coherente. El storyboard produjo exactamente seis viñetas y conservó un robot reconocible. La imagen de producto mostró refracción y reflejos convincentes en vidrio.

La muestra transparente era un PNG RGBA de 1664x2496 con alfa entre 0 y 255. Tiene píxeles realmente transparentes y opacos; no es un patrón de cuadros dibujado dentro de una imagen RGB. Es la capacidad diferencial más clara del lanzamiento.

Son ejemplos oficiales seleccionados, no una prueba ciega. No los republicamos aquí por la licencia de investigación; enlazamos la galería y describimos propiedades comprobables.

Benchmarks de Qwen-Image-2.1

El gráfico de Qwen publica 60.28 para Qwen-Image-2.1 en Qwen-Image-Bench. Es una señal útil dentro de la evaluación del fabricante, pero no un ranking independiente: benchmark, agregación y evaluación proceden del editor del modelo.

El GenAI Image Showdown independiente usa 15 tareas difíciles de fidelidad al prompt, permite ajustar el prompt a cada modelo y prohíbe edición e inpainting.

ModeloPruebas superadasCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
Qwen-Image original4 / 1568%

2.1 sube de 4 a 7 pruebas, aunque la métrica separada de compliance pasa de 68% a 67%. No es una contradicción: miden aspectos distintos. La lectura prudente es que mejora al original en esta pequeña prueba, pero no gana en seguimiento complejo de instrucciones.

El 60.28 oficial y el 7 / 15 independiente no deben mezclarse en una sola clasificación porque usan tareas y sistemas de puntuación diferentes.

2K nativo, RGBA y edición

Diffusers usa 2048x2048 y 40 pasos por defecto. Qwen recomienda, entre otros, 2400x1792 para 4:3, 1792x2400 para 3:4, 2752x1536 para 16:9 y 1536x2752 para 9:16.

“2K nativo” describe el lienzo previsto; no garantiza texto pequeño perfecto, recuentos exactos ni más detalle semántico. Resolución y fidelidad al prompt son pruebas distintas.

La edición admite hasta diez referencias en Diffusers, preservación de identidad de personas y productos, círculos o pintura para cambios locales, máscaras separadas, extracción de sujetos y capas transparentes. Para RGBA, Qwen recomienda pedir explícitamente canal alfa y fondo transparente y guardar PNG. JPEG no conserva alfa.

Requisitos de VRAM de Qwen-Image-2.1

ComponenteTamaño serializado aproximado
Codificador Qwen3-VL17.5 GB
Transformer DiT14.2 GB
VAE RGBA1.4 GB
Total33.1 GB

El tamaño en disco no es igual al pico de VRAM, pero el ejemplo BF16 con .to("cuda") no es una configuración cómoda de 24 GB. vLLM-Omni midió lo siguiente en una NVIDIA GB300, 1024x1024 y 40 pasos:

ConfiguraciónPico de memoriaTiempo por imagen
BF1634.0 GB3.28-4.49 s
DiT FP8, img_mlp sensible en BF1632.0-32.7 GB3.36-4.71 s
Codificador de texto FP827.5-28.1 GB3.43-4.77 s

Son datos de GB300 a 1024px, no de RTX 3090/4090 ni del 2K predeterminado. FP8 ahorró memoria, pero no aceleró esa prueba. Una tarjeta de 24 GB puede funcionar con cuantización, offload a CPU, VAE por mosaicos o un flujo comunitario de ComfyUI; debe tratarse como un proyecto de optimización, no como el punto de partida garantizado.

Instalación local con Diffusers

El inicio rápido instala Diffusers desde Git. Para reproducibilidad, use un entorno virtual y fije el commit probado.

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

Para editar con varias referencias, pase image=[...]. Registre semilla, prompt completo, commit del runtime, precisión, resolución y pasos; sin esos datos una comparación de calidad no es reproducible.

ComfyUI y servidores

ComfyUI incluye soporte nativo y workflows oficiales JSON para generación y edición. Es el punto de partida más sencillo para pruebas visuales y offload comunitario. Diffusers resulta más claro para una evaluación Python controlada; vLLM-Omni y SGLang se orientan a servicio, lotes, caché y FP8. Envíe 40 pasos de forma explícita y compruebe el máximo de referencias del runtime.

Licencia y uso comercial

La licencia publicada no concede uso comercial. Qwen Research License define Non-Commercial como investigación o evaluación y limita a ese ámbito el uso, modificación y distribución de los materiales.

UsoPosición de la licencia publicada
Investigación/evaluación internaPermitida bajo las condiciones del acuerdo
Redistribución de pesos o derivadosSujeta al límite no comercial y a avisos
Producto de pago o servicio comercialRequiere otra licencia comercial
Contactomodel-business@notice.qwencloud.com

Poder descargar los pesos no significa Apache-2.0 ni código abierto comercial. Si va a vender recursos generados o incluir el modelo en un servicio de pago, consiga términos por escrito y asesoramiento legal en lugar de deducir derechos de la palabra “open-source” del anuncio.

Para quién tiene sentido

Evalúelo si la transparencia nativa elimina un paso de recorte, necesita varias personas o productos de referencia, quiere generación y edición local en un modelo, dispone de más de 32 GB o acepta cuantización/offload y el uso es realmente investigación no comercial.

Espere si todavía no tiene licencia comercial, necesita 2K predecible en 24 GB, prioriza el cumplimiento exacto del prompt, exige datos maduros de tipografía multilingüe o necesita hoy una API gestionada de Qwen-Image-2.1 en OmniaKey.

Para una API de imagen ya disponible, consulte el análisis de Nano Banana 2 frente a Pro. El catálogo de modelos es la fuente de verdad sobre rutas de OmniaKey.

Límites de este análisis

No completamos una generación nueva porque el Demo estaba ocupado. Las observaciones visuales proceden de cuatro muestras oficiales seleccionadas. La comparación independiente solo tiene 15 tareas de texto a imagen y no mide edición ni transparencia. Los datos de hardware proceden de GB200/GB300, no de RTX de consumo. Este texto es análisis técnico, no asesoramiento jurídico.

Preguntas frecuentes

¿Qwen-Image-2.1 es de código abierto?

Código y pesos se descargan públicamente y Qwen lo denomina open-source. Sin embargo, los pesos usan una licencia de investigación que restringe el uso comercial. “Pesos abiertos con licencia de investigación” es más preciso que “código abierto sin restricciones”.

¿Cuánta VRAM necesita Qwen-Image-2.1?

Los archivos principales suman unos 33.1 GB. vLLM-Omni midió 34.0 GB en BF16 y 27.5-28.1 GB con el codificador de texto FP8 sobre GB300. Resolución, precisión, offload, runtime y GPU cambian el resultado.

¿Funciona en RTX 3090 o 4090?

No con la ruta BF16 completa .to("cuda") del ejemplo oficial. Cuantización y offload pueden hacerlo posible en 24 GB, pero la evidencia oficial del lanzamiento no demuestra velocidad ni estabilidad 2K en esas tarjetas.

¿Qwen-Image-2.1 funciona con ComfyUI?

Sí. ComfyUI publicó soporte nativo y workflows oficiales de texto a imagen y edición el mismo día del lanzamiento.

¿Cuántas imágenes de referencia admite?

Diffusers oficial admite hasta 10; vLLM-Omni actual admite 4. Compruebe el contrato del runtime que vaya a desplegar.

¿Se puede usar comercialmente?

La Qwen Research License publicada no concede ese uso. Solicite una licencia separada en model-business@notice.qwencloud.com y revise jurídicamente su caso.

¿Está Qwen-Image-2.1 en OmniaKey?

No a 21 de septiembre de 2026. El catálogo contiene rutas Qwen Image 3, pero no Qwen/Qwen-Image-2.1. Este análisis no anuncia disponibilidad.

Fuentes primarias

Evidencias comprobadas el 2026-09-21. El soporte, los límites y las opciones de licencia pueden cambiar; vuelva a las fuentes primarias antes de decidir un despliegue.