Le modèle Jev est désormais intégré et disponible · Bienvenue
Blogue
Guider

Test de Qwen-Image-2.1

Le RGBA natif et la retouche multi-référence sont convaincants, mais la licence réservée à la recherche et un plancher pratique de 28 à 34 Go en font un modèle à évaluer plutôt qu'un choix commercial par défaut.

14 minutes de lectureOmniaKey
Qwen-Image-2.1génération d'imagesretouche d'imagesComfyUIVRAM

Ce test de Qwen-Image-2.1 révèle un modèle d'image à poids ouverts intéressant pour deux fonctions rares : une sortie RGBA native et une seule pipeline pour générer et retoucher. Il révèle aussi deux contraintes décisives : les poids publics sont soumis à une licence de recherche non commerciale, et les fichiers principaux représentent environ 33.1 Go avant les frais d'exécution.

Il mérite une évaluation pour les visuels transparents, autocollants, détourages et compositions multi-références. Ce n'est pas encore le choix le plus simple pour un produit d'image commercial ni pour un GPU de 24 Go sans optimisation.

Vérifié le 21 septembre 2026. Nous avons consulté l'annonce, le dépôt, les fichiers Hugging Face, la licence, les guides Diffusers/ComfyUI, la recette vLLM-Omni, le graphique de Qwen et le GenAI Image Showdown indépendant. Nous avons aussi téléchargé quatre sorties officielles. Le Demo Hugging Face public étant saturé, notre génération personnalisée n'a pas abouti : il s'agit donc d'un test de lancement fondé sur les preuves, pas d'un benchmark maison. La galerie officielle est une sélection du fournisseur.

Test Qwen-Image-2.1 : la réponse courte

QuestionRéponse vérifiée
De quoi s'agit-il ?Modèle unifié texte-vers-image et retouche, ID Qwen/Qwen-Image-2.1
ArchitectureGénérateur visuel 7B, 32 couches Single-Stream DiT, encodeur Qwen3-VL 8B
Résolution2K natif ; 2048x2048 par défaut dans Diffusers
TransparenceGénération et retouche RGBA native à quatre canaux
Images de référenceJusqu'à 10 officiellement ; 4 dans vLLM-Omni actuellement
Échantillonnage40 étapes dans l'exemple Diffusers officiel
Empreinte localeEnviron 33.1 Go pour encodeur, Transformer et VAE, hors surcharge
LicenceQwen Research License, recherche/évaluation non commerciale uniquement
OmniaKeyAbsent du catalogue au 2026-09-21

La meilleure raison de le tester n'est pas son classement, mais l'association alpha réel, dix références et retouche locale. La licence, la mémoire et le peu d'évaluations indépendantes empêchent un déploiement aveugle.

Qu'est-ce que Qwen-Image-2.1 ?

Qwen a publié Qwen-Image-2.1 le 20 septembre 2026. Génération texte-vers-image, retouche d'une image, composition multi-référence, masques, annotations peintes et détourage transparent passent par la même pipeline.

Le « 7B » ne décrit que le générateur visuel, pas tout ce qui est chargé :

  • générateur 7B avec 32 couches Single-Stream DiT ;
  • encodeur Qwen3-VL 8B pour le texte et les images de référence ;
  • VAE à 64 canaux latents, compression spatiale 16x et quatre canaux d'entrée/sortie ;
  • RGB, RGBA, génération et retouche dans un seul modèle.

Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang et LightX2V ont annoncé une prise en charge dès le premier jour. Les limites varient : Diffusers annonce dix références, tandis que vLLM-Omni refuse actuellement une cinquième image.

Ce que montrent vraiment les exemples officiels

Nous avons inspecté les fichiers originaux. L'affiche reproduit correctement les deux lignes anglaises demandées, avec une hiérarchie et un espacement cohérents. Le storyboard contient exactement six cases et conserve un petit robot reconnaissable. L'image produit offre une réfraction du verre et des reflets convaincants.

Le fichier transparent est un PNG RGBA de 1664x2496, avec un alpha allant de 0 à 255. Il comporte de vrais pixels transparents et opaques, pas un damier peint dans une image RGB. C'est la différence la plus nette de cette version.

Ces images restent des exemples officiels sélectionnés, pas un test aveugle. Compte tenu de la licence de recherche, nous ne les republions pas et renvoyons vers la galerie officielle tout en donnant les propriétés vérifiables.

Benchmarks de Qwen-Image-2.1

Le graphique de Qwen attribue 60.28 à Qwen-Image-2.1 sur Qwen-Image-Bench. C'est une donnée utile du fournisseur, mais pas un classement indépendant : benchmark, agrégation et évaluation viennent de l'éditeur du modèle.

Le GenAI Image Showdown indépendant utilise 15 tâches difficiles de respect du prompt, autorise l'ajustement du prompt selon le modèle et interdit retouche et inpainting.

ModèleTâches réussiesCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
Qwen-Image original4 / 1568%

2.1 passe de 4 à 7 tâches réussies, alors que la métrique distincte compliance passe de 68% à 67%. Il n'y a pas de contradiction : les deux mesures ne couvrent pas la même chose. Ce petit test montre un progrès sur l'original, sans faire de 2.1 le meilleur modèle pour les consignes complexes.

Le 60.28 officiel et le 7 / 15 indépendant ne peuvent pas former un classement unique, car tâches et notation diffèrent.

2K natif, RGBA et retouche

Diffusers utilise 2048x2048 et 40 étapes par défaut. Qwen recommande notamment 2400x1792 en 4:3, 1792x2400 en 3:4, 2752x1536 en 16:9 et 1536x2752 en 9:16.

« 2K natif » décrit le canevas visé ; cela ne garantit ni petit texte parfait, ni nombre exact d'objets, ni davantage de détails sémantiques. Résolution et fidélité au prompt se testent séparément.

La retouche prend jusqu'à dix références dans Diffusers, préserve l'identité des personnes et produits, accepte cercles, peinture et masques séparés, extrait les sujets et retouche des calques transparents. Pour le RGBA, Qwen conseille de demander explicitement canal alpha et fond transparent, puis d'enregistrer en PNG. JPEG ne conserve pas l'alpha.

Mémoire VRAM requise

ComposantTaille sérialisée approximative
Encodeur texte/vision Qwen3-VL17.5 Go
Transformer DiT14.2 Go
VAE RGBA1.4 Go
Total33.1 Go

La taille sur disque n'est pas le pic VRAM, mais le chemin BF16 officiel .to("cuda") ne constitue pas une configuration confortable à 24 Go. vLLM-Omni a mesuré sur une NVIDIA GB300, en 1024x1024 et 40 étapes :

ConfigurationPic mémoireTemps par image
BF1634.0 Go3.28-4.49 s
DiT FP8, img_mlp sensible en BF1632.0-32.7 Go3.36-4.71 s
Encodeur texte FP827.5-28.1 Go3.43-4.77 s

Ce sont des mesures GB300 à 1024px, pas RTX 3090/4090 ni 2K par défaut. FP8 a surtout économisé de la mémoire et n'a pas accéléré ce test. Une carte 24 Go peut fonctionner avec quantification, offload CPU, VAE en tuiles ou workflow ComfyUI communautaire, mais c'est un projet d'optimisation plutôt qu'une base garantie.

Installation locale avec Diffusers

Le guide officiel installe Diffusers depuis Git. Pour une évaluation reproductible, utilisez un environnement virtuel et figez le commit testé.

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

Pour plusieurs références, passez image=[...]. Conservez seed, prompt complet, commit du runtime, précision, résolution et nombre d'étapes afin de rendre toute comparaison reproductible.

ComfyUI et serving

ComfyUI dispose d'un support natif et de workflows JSON officiels de génération et retouche. Il convient aux essais visuels et aux solutions d'offload communautaires. Diffusers est plus clair pour une évaluation Python contrôlée ; vLLM-Omni et SGLang visent service, lot, cache et FP8. Envoyez explicitement 40 étapes et vérifiez la limite de références du runtime.

Licence et usage commercial

La licence publiée n'accorde pas l'usage commercial. Qwen Research License définit Non-Commercial comme recherche ou évaluation et limite à ce cadre l'utilisation, la modification et la distribution des matériaux.

UsagePosition de la licence publiée
Recherche/évaluation interneAutorisée sous les conditions de l'accord
Redistribution de poids ou dérivésSoumise au cadre non commercial et aux mentions
Produit payant ou service commercialLicence commerciale distincte requise
Contactmodel-business@notice.qwencloud.com

Des poids téléchargeables ne signifient ni Apache-2.0 ni open source commercial. Pour vendre des visuels générés ou intégrer le modèle à un service payant, obtenez des conditions écrites et un avis juridique au lieu de déduire des droits du mot « open-source » dans l'annonce.

À qui s'adresse le modèle ?

Évaluez-le si la transparence native supprime une étape de détourage, si plusieurs personnes ou produits doivent être référencés, si un modèle local doit générer et retoucher, si vous avez plus de 32 Go ou acceptez quantification/offload, et si l'usage est réellement une recherche non commerciale.

Attendez si vous n'avez pas de licence commerciale, exigez du 2K clé en main sur 24 Go, privilégiez le respect exact du prompt, avez besoin de données mûres sur la typographie multilingue ou cherchez aujourd'hui une API Qwen-Image-2.1 gérée par OmniaKey.

Pour une API d'image déjà disponible, consultez le comparatif Nano Banana 2 et Pro. Le catalogue de modèles fait foi pour la disponibilité OmniaKey.

Limites de ce test

La génération personnalisée n'a pas abouti, le Demo étant saturé. Les observations visuelles portent sur quatre exemples officiels sélectionnés. L'évaluation indépendante ne compte que 15 tâches texte-vers-image et ne mesure ni retouche ni transparence. Les chiffres matériels viennent de GB200/GB300, pas de RTX grand public. Cet article est une analyse technique, pas un conseil juridique.

Questions fréquentes

Qwen-Image-2.1 est-il open source ?

Code et poids sont téléchargeables et Qwen parle d'open-source. Toutefois, les poids utilisent une licence de recherche qui restreint le commercial. « Poids ouverts sous licence de recherche » est plus précis qu'open source sans restriction.

Combien de VRAM faut-il ?

Les fichiers principaux totalisent environ 33.1 Go. vLLM-Omni a mesuré 34.0 Go en BF16 et 27.5-28.1 Go avec l'encodeur texte FP8 sur GB300. Résolution, précision, offload, runtime et GPU changent le résultat.

Fonctionne-t-il sur RTX 3090 ou 4090 ?

Pas avec le chemin BF16 complet .to("cuda") de l'exemple officiel. Quantification et offload peuvent rendre 24 Go possibles, mais les données officielles ne prouvent ni vitesse ni stabilité 2K sur ces cartes.

Qwen-Image-2.1 prend-il en charge ComfyUI ?

Oui. ComfyUI a publié le support natif et des workflows officiels texte-vers-image et retouche dès le lancement.

Combien d'images de référence ?

Diffusers officiel en accepte jusqu'à 10 ; vLLM-Omni actuel en accepte 4. Vérifiez le runtime réellement déployé.

Peut-on l'utiliser commercialement ?

La Qwen Research License publique ne l'autorise pas. Demandez une licence distincte à model-business@notice.qwencloud.com et faites vérifier votre usage.

Qwen-Image-2.1 est-il disponible sur OmniaKey ?

Non au 21 septembre 2026. Le catalogue contient des routes Qwen Image 3, mais pas Qwen/Qwen-Image-2.1. Ce test n'annonce aucune disponibilité.

Sources primaires

Preuves vérifiées le 2026-09-21. Runtime, limites et options de licence peuvent évoluer ; relisez les sources primaires avant toute décision de production.