Análisis de Qwen-Image-2.1
El RGBA nativo y la edición con varias referencias destacan, pero la licencia solo para investigación y un mínimo práctico de unos 28-34 GB lo convierten en un modelo para evaluar, no en una opción comercial predeterminada.
Este Qwen-Image-2.1 análisis encuentra un modelo de pesos abiertos muy interesante por dos motivos poco habituales: salida RGBA nativa y una sola canalización para generar y editar. También encuentra dos límites decisivos: los pesos públicos tienen una licencia de investigación no comercial y sus archivos principales ocupan unos 33.1 GB antes de sumar la memoria de ejecución.
Merece una evaluación para recursos transparentes, pegatinas, extracción de sujetos y composiciones con varias referencias. No es todavía la opción más sencilla para un producto de imágenes comercial ni para una GPU de 24 GB sin optimización.
Comprobado el 21 de septiembre de 2026. Revisamos el anuncio, repositorio, archivos de Hugging Face, licencia, instrucciones de Diffusers y ComfyUI, receta de vLLM-Omni, gráfico oficial de Qwen y GenAI Image Showdown. También descargamos cuatro muestras oficiales. La generación propia en el Demo público no terminó porque el Space estaba ocupado; por eso este es un análisis de lanzamiento basado en evidencias, no un benchmark propio. La galería oficial contiene muestras seleccionadas por el proveedor.
Qwen-Image-2.1 análisis: respuesta rápida
| Pregunta | Respuesta verificada |
|---|---|
| Qué es | Modelo unificado de texto a imagen y edición, ID Qwen/Qwen-Image-2.1 |
| Arquitectura | Generador visual 7B, 32 capas Single-Stream DiT y codificador Qwen3-VL 8B |
| Resolución | 2K nativo; Diffusers usa 2048x2048 por defecto |
| Transparencia | Generación y edición RGBA de cuatro canales |
| Imágenes de referencia | Hasta 10 en la canalización oficial; 4 en vLLM-Omni actual |
| Muestreo | 40 pasos en el ejemplo oficial de Diffusers |
| Huella local | Unos 33.1 GB en codificador, Transformer y VAE, antes del overhead |
| Licencia | Qwen Research License, solo investigación/evaluación no comercial |
| OmniaKey | No figura en el catálogo a 2026-09-21 |
La razón principal para probarlo no es una posición en una tabla, sino la combinación de alfa real, diez referencias y edición local. Las razones para no desplegarlo sin más son igualmente concretas: licencia, memoria y poca evaluación independiente.
Qué es Qwen-Image-2.1
Qwen publicó Qwen-Image-2.1 el 20 de septiembre de 2026. Texto a imagen, edición de una imagen, composición multirreferencia, máscaras, anotaciones pintadas y extracción transparente pasan por la misma canalización.
La etiqueta 7B solo describe el generador visual, no todo lo que se carga:
- generador visual de 7B parámetros y 32 capas Single-Stream DiT;
- codificador Qwen3-VL 8B para texto e imágenes de referencia;
- VAE de 64 canales latentes, compresión espacial 16x y entrada/salida de cuatro canales;
- tareas RGB, RGBA, generación y edición en el mismo modelo.
Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang y LightX2V anunciaron soporte desde el primer día. Los límites dependen del runtime: Diffusers documenta diez referencias, pero vLLM-Omni rechaza una quinta imagen.
Qué muestran las muestras oficiales
Inspeccionamos los archivos originales, no solo las miniaturas. El póster escribió correctamente las dos líneas inglesas solicitadas y mantuvo una jerarquía tipográfica coherente. El storyboard produjo exactamente seis viñetas y conservó un robot reconocible. La imagen de producto mostró refracción y reflejos convincentes en vidrio.
La muestra transparente era un PNG RGBA de 1664x2496 con alfa entre 0 y 255. Tiene píxeles realmente transparentes y opacos; no es un patrón de cuadros dibujado dentro de una imagen RGB. Es la capacidad diferencial más clara del lanzamiento.
Son ejemplos oficiales seleccionados, no una prueba ciega. No los republicamos aquí por la licencia de investigación; enlazamos la galería y describimos propiedades comprobables.
Benchmarks de Qwen-Image-2.1
El gráfico de Qwen publica 60.28 para Qwen-Image-2.1 en Qwen-Image-Bench. Es una señal útil dentro de la evaluación del fabricante, pero no un ranking independiente: benchmark, agregación y evaluación proceden del editor del modelo.
El GenAI Image Showdown independiente usa 15 tareas difíciles de fidelidad al prompt, permite ajustar el prompt a cada modelo y prohíbe edición e inpainting.
| Modelo | Pruebas superadas | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| Qwen-Image original | 4 / 15 | 68% |
2.1 sube de 4 a 7 pruebas, aunque la métrica separada de compliance pasa de 68% a 67%. No es una contradicción: miden aspectos distintos. La lectura prudente es que mejora al original en esta pequeña prueba, pero no gana en seguimiento complejo de instrucciones.
El 60.28 oficial y el 7 / 15 independiente no deben mezclarse en una sola clasificación porque usan tareas y sistemas de puntuación diferentes.
2K nativo, RGBA y edición
Diffusers usa 2048x2048 y 40 pasos por defecto. Qwen recomienda, entre otros, 2400x1792 para 4:3, 1792x2400 para 3:4, 2752x1536 para 16:9 y 1536x2752 para 9:16.
“2K nativo” describe el lienzo previsto; no garantiza texto pequeño perfecto, recuentos exactos ni más detalle semántico. Resolución y fidelidad al prompt son pruebas distintas.
La edición admite hasta diez referencias en Diffusers, preservación de identidad de personas y productos, círculos o pintura para cambios locales, máscaras separadas, extracción de sujetos y capas transparentes. Para RGBA, Qwen recomienda pedir explícitamente canal alfa y fondo transparente y guardar PNG. JPEG no conserva alfa.
Requisitos de VRAM de Qwen-Image-2.1
| Componente | Tamaño serializado aproximado |
|---|---|
| Codificador Qwen3-VL | 17.5 GB |
| Transformer DiT | 14.2 GB |
| VAE RGBA | 1.4 GB |
| Total | 33.1 GB |
El tamaño en disco no es igual al pico de VRAM, pero el ejemplo BF16 con .to("cuda") no es una configuración cómoda de 24 GB. vLLM-Omni midió lo siguiente en una NVIDIA GB300, 1024x1024 y 40 pasos:
| Configuración | Pico de memoria | Tiempo por imagen |
|---|---|---|
| BF16 | 34.0 GB | 3.28-4.49 s |
DiT FP8, img_mlp sensible en BF16 | 32.0-32.7 GB | 3.36-4.71 s |
| Codificador de texto FP8 | 27.5-28.1 GB | 3.43-4.77 s |
Son datos de GB300 a 1024px, no de RTX 3090/4090 ni del 2K predeterminado. FP8 ahorró memoria, pero no aceleró esa prueba. Una tarjeta de 24 GB puede funcionar con cuantización, offload a CPU, VAE por mosaicos o un flujo comunitario de ComfyUI; debe tratarse como un proyecto de optimización, no como el punto de partida garantizado.
Instalación local con Diffusers
El inicio rápido instala Diffusers desde Git. Para reproducibilidad, use un entorno virtual y fije el commit probado.
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
Para editar con varias referencias, pase image=[...]. Registre semilla, prompt completo, commit del runtime, precisión, resolución y pasos; sin esos datos una comparación de calidad no es reproducible.
ComfyUI y servidores
ComfyUI incluye soporte nativo y workflows oficiales JSON para generación y edición. Es el punto de partida más sencillo para pruebas visuales y offload comunitario. Diffusers resulta más claro para una evaluación Python controlada; vLLM-Omni y SGLang se orientan a servicio, lotes, caché y FP8. Envíe 40 pasos de forma explícita y compruebe el máximo de referencias del runtime.
Licencia y uso comercial
La licencia publicada no concede uso comercial. Qwen Research License define Non-Commercial como investigación o evaluación y limita a ese ámbito el uso, modificación y distribución de los materiales.
| Uso | Posición de la licencia publicada |
|---|---|
| Investigación/evaluación interna | Permitida bajo las condiciones del acuerdo |
| Redistribución de pesos o derivados | Sujeta al límite no comercial y a avisos |
| Producto de pago o servicio comercial | Requiere otra licencia comercial |
| Contacto | model-business@notice.qwencloud.com |
Poder descargar los pesos no significa Apache-2.0 ni código abierto comercial. Si va a vender recursos generados o incluir el modelo en un servicio de pago, consiga términos por escrito y asesoramiento legal en lugar de deducir derechos de la palabra “open-source” del anuncio.
Para quién tiene sentido
Evalúelo si la transparencia nativa elimina un paso de recorte, necesita varias personas o productos de referencia, quiere generación y edición local en un modelo, dispone de más de 32 GB o acepta cuantización/offload y el uso es realmente investigación no comercial.
Espere si todavía no tiene licencia comercial, necesita 2K predecible en 24 GB, prioriza el cumplimiento exacto del prompt, exige datos maduros de tipografía multilingüe o necesita hoy una API gestionada de Qwen-Image-2.1 en OmniaKey.
Para una API de imagen ya disponible, consulte el análisis de Nano Banana 2 frente a Pro. El catálogo de modelos es la fuente de verdad sobre rutas de OmniaKey.
Límites de este análisis
No completamos una generación nueva porque el Demo estaba ocupado. Las observaciones visuales proceden de cuatro muestras oficiales seleccionadas. La comparación independiente solo tiene 15 tareas de texto a imagen y no mide edición ni transparencia. Los datos de hardware proceden de GB200/GB300, no de RTX de consumo. Este texto es análisis técnico, no asesoramiento jurídico.
Preguntas frecuentes
¿Qwen-Image-2.1 es de código abierto?
Código y pesos se descargan públicamente y Qwen lo denomina open-source. Sin embargo, los pesos usan una licencia de investigación que restringe el uso comercial. “Pesos abiertos con licencia de investigación” es más preciso que “código abierto sin restricciones”.
¿Cuánta VRAM necesita Qwen-Image-2.1?
Los archivos principales suman unos 33.1 GB. vLLM-Omni midió 34.0 GB en BF16 y 27.5-28.1 GB con el codificador de texto FP8 sobre GB300. Resolución, precisión, offload, runtime y GPU cambian el resultado.
¿Funciona en RTX 3090 o 4090?
No con la ruta BF16 completa .to("cuda") del ejemplo oficial. Cuantización y offload pueden hacerlo posible en 24 GB, pero la evidencia oficial del lanzamiento no demuestra velocidad ni estabilidad 2K en esas tarjetas.
¿Qwen-Image-2.1 funciona con ComfyUI?
Sí. ComfyUI publicó soporte nativo y workflows oficiales de texto a imagen y edición el mismo día del lanzamiento.
¿Cuántas imágenes de referencia admite?
Diffusers oficial admite hasta 10; vLLM-Omni actual admite 4. Compruebe el contrato del runtime que vaya a desplegar.
¿Se puede usar comercialmente?
La Qwen Research License publicada no concede ese uso. Solicite una licencia separada en model-business@notice.qwencloud.com y revise jurídicamente su caso.
¿Está Qwen-Image-2.1 en OmniaKey?
No a 21 de septiembre de 2026. El catálogo contiene rutas Qwen Image 3, pero no Qwen/Qwen-Image-2.1. Este análisis no anuncia disponibilidad.
Fuentes primarias
- Anuncio de Qwen
- Repositorio oficial y guía rápida
- Qwen Research License
- Archivos en Hugging Face
- Workflow de texto a imagen en ComfyUI
- Workflow de edición en ComfyUI
- Receta de vLLM-Omni
- Qwen-Image-Bench
- GenAI Image Showdown independiente
Evidencias comprobadas el 2026-09-21. El soporte, los límites y las opciones de licencia pueden cambiar; vuelva a las fuentes primarias antes de decidir un despliegue.