Qwen-Image-2.1 im Test
Native RGBA-Ausgabe und Bearbeitung mit mehreren Referenzen sind stark, doch die reine Forschungslizenz und rund 28-34 GB praktischer Speicherbedarf machen das Modell vorerst zum Evaluationskandidaten.
Dieser Qwen-Image-2.1 Test zeigt ein technisch spannendes Open-Weight-Bildmodell mit zwei seltenen Stärken: nativer RGBA-Ausgabe und einer gemeinsamen Pipeline für Generierung und Bearbeitung. Zwei Grenzen sind ebenso wichtig: Die veröffentlichten Gewichte stehen unter einer nichtkommerziellen Forschungslizenz, und allein die zentralen Dateien umfassen etwa 33.1 GB.
Für transparente Produktassets, Sticker, Freistellung und Kompositionen mit mehreren Referenzen lohnt sich eine Evaluation. Als unkomplizierter kommerzieller Standard oder reiner 24-GB-Workflow eignet es sich noch nicht.
Geprüft am 21. September 2026. Wir haben Release, Repository, Hugging-Face-Dateien, Lizenz, Diffusers-/ComfyUI-Anleitungen, vLLM-Omni-Rezept, Qwens Benchmarkgrafik und den unabhängigen GenAI Image Showdown geprüft. Vier offizielle Originalbeispiele wurden ebenfalls untersucht. Ein eigener Lauf im öffentlichen Hugging-Face-Demo endete wegen Auslastung ohne Ergebnis. Dies ist daher ein evidenzbasierter Launch-Test, kein behaupteter eigener Benchmark; die offizielle Galerie enthält kuratierte Herstellerbeispiele.
Qwen-Image-2.1 Test: Kurzfazit
| Frage | Verifizierte Antwort |
|---|---|
| Was ist es? | Einheitliches Text-zu-Bild- und Bearbeitungsmodell Qwen/Qwen-Image-2.1 |
| Architektur | 7B-Bildgenerator, 32 Single-Stream-DiT-Layer, Qwen3-VL 8B Encoder |
| Auflösung | Nativ 2K; Diffusers startet standardmäßig mit 2048x2048 |
| Transparenz | Native Erzeugung und Bearbeitung von RGBA mit vier Kanälen |
| Referenzbilder | Bis zu 10 offiziell; aktuell 4 in vLLM-Omni |
| Sampling | 40 Schritte im offiziellen Diffusers-Beispiel |
| Lokaler Umfang | Rund 33.1 GB für Encoder, Transformer und VAE vor Laufzeit-Overhead |
| Lizenz | Qwen Research License, nur nichtkommerzielle Forschung/Evaluation |
| OmniaKey | Am 2026-09-21 nicht im Katalog |
Das überzeugendste Argument ist nicht der Rang, sondern echtes Alpha, zehn Referenzen und lokale Bearbeitung. Gegen einen blinden Produktiveinsatz sprechen Lizenz, Speicher und die noch schmale unabhängige Datenlage.
Was ist Qwen-Image-2.1?
Qwen veröffentlichte das Modell am 20. September 2026. Text-zu-Bild, Einzelbildbearbeitung, Multi-Referenz-Komposition, Masken, eingezeichnete Hinweise und transparente Freistellung laufen durch dieselbe Pipeline.
Die Bezeichnung 7B betrifft nur den visuellen Generator, nicht den gesamten geladenen Stack:
- 7B visueller Generator mit 32 Single-Stream-DiT-Layern;
- Qwen3-VL 8B Encoder für Prompts und Referenzbilder;
- VAE mit 64 latenten Kanälen, 16-facher räumlicher Kompression und vier Ein-/Ausgabekanälen;
- RGB, RGBA, Erzeugung und Bearbeitung in einem Modell.
Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang und LightX2V meldeten Day-0-Support. Die Grenzen sind laufzeitspezifisch: Die offizielle Diffusers-Pipeline nennt zehn Referenzen, vLLM-Omni lehnt derzeit ein fünftes Bild ab.
Was die offiziellen Beispiele belegen
Wir prüften die Originaldateien statt nur Webseiten-Thumbnails. Das Poster gab beide angeforderten englischen Zeilen korrekt wieder. Das Storyboard bestand exakt aus sechs Panels und hielt den kleinen Roboter erkennbar konsistent. Das Produktbild zeigte überzeugende Glasbrechung und klar getrennte Oberflächen.
Das transparente Beispiel ist eine 1664x2496 große RGBA-PNG mit Alpha-Werten von 0 bis 255. Es enthält echte vollständig transparente und deckende Pixel und kein gemaltes Schachbrett in einem RGB-Bild. Das ist die klarste besondere Fähigkeit des Releases.
Alle vier Bilder sind ausgewählte Herstellerbeispiele, keine Blindtests. Wegen der Forschungslizenz veröffentlichen wir sie nicht erneut, sondern verlinken die offizielle Galerie und dokumentieren prüfbare Eigenschaften.
Qwen-Image-2.1 Benchmarks
Qwens eigene Grafik weist 60.28 auf Qwen-Image-Bench aus. Das ist nützliche Hersteller-Evidenz, aber kein unabhängiges Ranking, weil Benchmark, Aggregation und Auswertung vom Modellanbieter stammen.
Der unabhängige GenAI Image Showdown prüft 15 schwierige Prompt-Compliance-Aufgaben, erlaubt modellspezifische Prompt-Anpassung und verbietet Editing sowie Inpainting.
| Modell | Bestandene Aufgaben | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| Ursprüngliches Qwen-Image | 4 / 15 | 68% |
2.1 verbessert die bestandenen Aufgaben von 4 auf 7, während die separate Compliance-Zahl von 68% auf 67% fällt. Das ist kein Widerspruch, da beide Kennzahlen Unterschiedliches messen. In diesem kleinen Test verbessert sich 2.1, bleibt bei komplexer Befolgung aber hinter dem stärksten geschlossenen Modell.
Die offiziellen 60.28 und unabhängigen 7 / 15 lassen sich wegen anderer Aufgaben und Bewertung nicht zu einer Tabelle verschmelzen.
Native 2K, RGBA und Bildbearbeitung
Diffusers nutzt standardmäßig 2048x2048 und 40 Denoising-Schritte. Empfohlen werden unter anderem 2400x1792 für 4:3, 1792x2400 für 3:4, 2752x1536 für 16:9 und 1536x2752 für 9:16.
„Nativ 2K“ bezeichnet die Ziel-Arbeitsfläche. Es garantiert weder perfekte kleine Schrift noch exakte Objektzahlen oder mehr semantische Details. Auflösung und Prompt-Treue sind getrennte Tests.
Editing unterstützt bis zu zehn Referenzen in Diffusers, Identitätserhalt für Menschen und Produkte, Kreise oder gemalte Markierungen, separate Masken, Freistellung und transparente Layer. Für RGBA empfiehlt Qwen, Alphakanal und transparenten Hintergrund explizit zu verlangen und als PNG zu speichern; JPEG kann Alpha nicht erhalten.
VRAM-Anforderungen von Qwen-Image-2.1
| Komponente | Ungefähre Dateigröße |
|---|---|
| Qwen3-VL Text-/Bildencoder | 17.5 GB |
| DiT Transformer | 14.2 GB |
| RGBA VAE | 1.4 GB |
| Gesamt | 33.1 GB |
Dateigröße ist nicht gleich Peak-VRAM, doch der offizielle BF16-Pfad mit .to("cuda") ist keine bequeme 24-GB-Konfiguration. vLLM-Omni maß auf einer NVIDIA GB300 bei 1024x1024 und 40 Schritten:
| Konfiguration | Peak-Speicher | Zeit pro Bild |
|---|---|---|
| BF16 | 34.0 GB | 3.28-4.49 s |
DiT FP8, sensibles img_mlp in BF16 | 32.0-32.7 GB | 3.36-4.71 s |
| Textencoder FP8 | 27.5-28.1 GB | 3.43-4.77 s |
Das sind GB300-Messungen bei 1024px, keine RTX-3090/4090- oder Standard-2K-Werte. FP8 sparte vor allem Speicher und war nicht schneller. 24 GB können mit Quantisierung, CPU-Offload, VAE-Tiling oder Community-ComfyUI-Workflows funktionieren; dies ist aber ein Optimierungsprojekt statt einer zugesicherten Baseline.
Lokale Installation mit Diffusers
Der Quick Start installiert Diffusers direkt aus Git. Für reproduzierbare Tests sollten virtuelle Umgebung und getesteter Commit festgeschrieben werden.
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
Mehrere Referenzen werden als image=[...] übergeben. Seed, vollständiger Prompt, Runtime-Commit, Präzision, Auflösung und Schrittzahl gehören ins Testprotokoll; sonst ist ein Qualitätsvergleich nicht reproduzierbar.
ComfyUI und Serving
ComfyUI bietet nativen Support und offizielle JSON-Workflows für Generierung und Bearbeitung. Es ist bequem für visuelle Experimente und Community-Offload, während Diffusers kontrollierte Python-Tests erleichtert. vLLM-Omni und SGLang zielen auf Serving, Batching, Cache und FP8. Setzen Sie 40 Schritte explizit und prüfen Sie das Referenzlimit der konkreten Runtime.
Lizenz und kommerzielle Nutzung
Die veröffentlichte Lizenz erlaubt keine kommerzielle Nutzung. Die Qwen Research License definiert Non-Commercial als Forschung oder Evaluation und gewährt Nutzung, Änderung und Verteilung nur für nichtkommerzielle Zwecke.
| Nutzung | Aussage der veröffentlichten Lizenz |
|---|---|
| Interne Forschung/Evaluation | Unter den Vertragsbedingungen erlaubt |
| Weitergabe von Gewichten/Ableitungen | Nichtkommerzieller Rahmen und Hinweise gelten |
| Bezahlprodukt oder kommerzieller Dienst | Separate kommerzielle Lizenz erforderlich |
| Kontakt | model-business@notice.qwencloud.com |
Herunterladbare Gewichte bedeuten weder Apache-2.0 noch freie kommerzielle Nutzung. Wer generierte Assets verkauft oder das Modell in einen Bezahldienst integriert, sollte schriftliche Bedingungen und Rechtsberatung einholen, statt aus dem Wort „open-source“ im Launchpost Rechte abzuleiten.
Für wen lohnt sich das Modell?
Eine Evaluation lohnt sich, wenn native Transparenz den Freistellungsschritt spart, mehrere Personen oder Produkte referenziert werden, ein lokales Modell Erzeugung und Editing abdecken soll, mehr als 32 GB verfügbar sind oder Quantisierung/Offload akzeptabel ist und der Zweck tatsächlich nichtkommerzielle Forschung ist.
Warten Sie bei fehlender kommerzieller Lizenz, zwingendem Plug-and-play-2K auf 24 GB, höchster Prompt-Treue, Bedarf an reifen unabhängigen Daten oder wenn heute eine verwaltete Qwen-Image-2.1-API auf OmniaKey benötigt wird.
Für eine bereits verfügbare Bild-API vergleicht der Nano-Banana-2-vs-Pro-Test echte Generierungs- und Editing-Fälle. Der Modellkatalog ist maßgeblich für OmniaKey-Verfügbarkeit.
Grenzen dieses Tests
Wegen Demo-Auslastung wurde kein eigener Lauf abgeschlossen. Die visuellen Aussagen beruhen auf vier kuratierten offiziellen Bildern. Der unabhängige Test umfasst nur 15 Text-zu-Bild-Aufgaben und keine Transparenz oder Bearbeitung. Hardwarewerte stammen von GB200/GB300 statt Consumer-RTX. Dieser Beitrag ist technische Analyse, keine Rechtsberatung.
Häufige Fragen
Ist Qwen-Image-2.1 Open Source?
Code und Gewichte sind öffentlich herunterladbar und Qwen nennt das Modell open-source. Die Gewichte stehen jedoch unter einer kommerziell eingeschränkten Forschungslizenz. „Open Weight mit Forschungslizenz“ ist präziser als uneingeschränktes Open Source.
Wie viel VRAM braucht Qwen-Image-2.1?
Die Hauptdateien umfassen etwa 33.1 GB. vLLM-Omni maß 34.0 GB BF16 und 27.5-28.1 GB mit FP8-Textencoder auf GB300. Auflösung, Präzision, Offload, Runtime und GPU verändern das Ergebnis.
Läuft es auf RTX 3090 oder 4090?
Nicht mit dem vollständigen offiziellen BF16-.to("cuda")-Pfad. Quantisierung und Offload können 24 GB ermöglichen, doch offizielle Launchdaten belegen weder Geschwindigkeit noch native 2K-Stabilität auf diesen Karten.
Unterstützt Qwen-Image-2.1 ComfyUI?
Ja. ComfyUI lieferte am Releasetag nativen Support sowie offizielle Text-zu-Bild- und Bearbeitungsworkflows.
Wie viele Referenzbilder sind möglich?
Offizielles Diffusers unterstützt bis zu 10, aktuelles vLLM-Omni 4. Maßgeblich ist die eingesetzte Runtime.
Ist kommerzielle Nutzung erlaubt?
Nicht durch die veröffentlichte Qwen Research License. Eine separate Lizenz kann unter model-business@notice.qwencloud.com angefragt werden; klären Sie den konkreten Zweck rechtlich.
Ist Qwen-Image-2.1 auf OmniaKey verfügbar?
Nein, Stand 21. September 2026. Der Katalog enthält Qwen-Image-3-Routen, aber nicht Qwen/Qwen-Image-2.1. Dieser Test ist keine Verfügbarkeitsankündigung.
Primärquellen
- Offizieller Qwen-Launch
- Repository und Quick Start
- Qwen Research License
- Hugging-Face-Modelldateien
- ComfyUI Text-zu-Bild-Workflow
- ComfyUI Editing-Workflow
- vLLM-Omni-Rezept
- Qwen-Image-Bench
- Unabhängiger GenAI Image Showdown
Evidenz geprüft am 2026-09-21. Runtime, Grenzen und Lizenzoptionen können sich ändern; prüfen Sie vor Produktiventscheidungen erneut die Primärquellen.