Das Jev-Modell ist jetzt integriert und live · Herzlich willkommen
Blog
Leitfaden

Qwen-Image-2.1 im Test

Native RGBA-Ausgabe und Bearbeitung mit mehreren Referenzen sind stark, doch die reine Forschungslizenz und rund 28-34 GB praktischer Speicherbedarf machen das Modell vorerst zum Evaluationskandidaten.

14 Min. LesezeitOmniaKey
Qwen-Image-2.1BildgenerierungBildbearbeitungComfyUIVRAM

Dieser Qwen-Image-2.1 Test zeigt ein technisch spannendes Open-Weight-Bildmodell mit zwei seltenen Stärken: nativer RGBA-Ausgabe und einer gemeinsamen Pipeline für Generierung und Bearbeitung. Zwei Grenzen sind ebenso wichtig: Die veröffentlichten Gewichte stehen unter einer nichtkommerziellen Forschungslizenz, und allein die zentralen Dateien umfassen etwa 33.1 GB.

Für transparente Produktassets, Sticker, Freistellung und Kompositionen mit mehreren Referenzen lohnt sich eine Evaluation. Als unkomplizierter kommerzieller Standard oder reiner 24-GB-Workflow eignet es sich noch nicht.

Geprüft am 21. September 2026. Wir haben Release, Repository, Hugging-Face-Dateien, Lizenz, Diffusers-/ComfyUI-Anleitungen, vLLM-Omni-Rezept, Qwens Benchmarkgrafik und den unabhängigen GenAI Image Showdown geprüft. Vier offizielle Originalbeispiele wurden ebenfalls untersucht. Ein eigener Lauf im öffentlichen Hugging-Face-Demo endete wegen Auslastung ohne Ergebnis. Dies ist daher ein evidenzbasierter Launch-Test, kein behaupteter eigener Benchmark; die offizielle Galerie enthält kuratierte Herstellerbeispiele.

Qwen-Image-2.1 Test: Kurzfazit

FrageVerifizierte Antwort
Was ist es?Einheitliches Text-zu-Bild- und Bearbeitungsmodell Qwen/Qwen-Image-2.1
Architektur7B-Bildgenerator, 32 Single-Stream-DiT-Layer, Qwen3-VL 8B Encoder
AuflösungNativ 2K; Diffusers startet standardmäßig mit 2048x2048
TransparenzNative Erzeugung und Bearbeitung von RGBA mit vier Kanälen
ReferenzbilderBis zu 10 offiziell; aktuell 4 in vLLM-Omni
Sampling40 Schritte im offiziellen Diffusers-Beispiel
Lokaler UmfangRund 33.1 GB für Encoder, Transformer und VAE vor Laufzeit-Overhead
LizenzQwen Research License, nur nichtkommerzielle Forschung/Evaluation
OmniaKeyAm 2026-09-21 nicht im Katalog

Das überzeugendste Argument ist nicht der Rang, sondern echtes Alpha, zehn Referenzen und lokale Bearbeitung. Gegen einen blinden Produktiveinsatz sprechen Lizenz, Speicher und die noch schmale unabhängige Datenlage.

Was ist Qwen-Image-2.1?

Qwen veröffentlichte das Modell am 20. September 2026. Text-zu-Bild, Einzelbildbearbeitung, Multi-Referenz-Komposition, Masken, eingezeichnete Hinweise und transparente Freistellung laufen durch dieselbe Pipeline.

Die Bezeichnung 7B betrifft nur den visuellen Generator, nicht den gesamten geladenen Stack:

  • 7B visueller Generator mit 32 Single-Stream-DiT-Layern;
  • Qwen3-VL 8B Encoder für Prompts und Referenzbilder;
  • VAE mit 64 latenten Kanälen, 16-facher räumlicher Kompression und vier Ein-/Ausgabekanälen;
  • RGB, RGBA, Erzeugung und Bearbeitung in einem Modell.

Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang und LightX2V meldeten Day-0-Support. Die Grenzen sind laufzeitspezifisch: Die offizielle Diffusers-Pipeline nennt zehn Referenzen, vLLM-Omni lehnt derzeit ein fünftes Bild ab.

Was die offiziellen Beispiele belegen

Wir prüften die Originaldateien statt nur Webseiten-Thumbnails. Das Poster gab beide angeforderten englischen Zeilen korrekt wieder. Das Storyboard bestand exakt aus sechs Panels und hielt den kleinen Roboter erkennbar konsistent. Das Produktbild zeigte überzeugende Glasbrechung und klar getrennte Oberflächen.

Das transparente Beispiel ist eine 1664x2496 große RGBA-PNG mit Alpha-Werten von 0 bis 255. Es enthält echte vollständig transparente und deckende Pixel und kein gemaltes Schachbrett in einem RGB-Bild. Das ist die klarste besondere Fähigkeit des Releases.

Alle vier Bilder sind ausgewählte Herstellerbeispiele, keine Blindtests. Wegen der Forschungslizenz veröffentlichen wir sie nicht erneut, sondern verlinken die offizielle Galerie und dokumentieren prüfbare Eigenschaften.

Qwen-Image-2.1 Benchmarks

Qwens eigene Grafik weist 60.28 auf Qwen-Image-Bench aus. Das ist nützliche Hersteller-Evidenz, aber kein unabhängiges Ranking, weil Benchmark, Aggregation und Auswertung vom Modellanbieter stammen.

Der unabhängige GenAI Image Showdown prüft 15 schwierige Prompt-Compliance-Aufgaben, erlaubt modellspezifische Prompt-Anpassung und verbietet Editing sowie Inpainting.

ModellBestandene AufgabenCompliance
OpenAI GPT-Image 212 / 1598%
Ideogram 48 / 1563%
Qwen-Image-2.17 / 1567%
Ursprüngliches Qwen-Image4 / 1568%

2.1 verbessert die bestandenen Aufgaben von 4 auf 7, während die separate Compliance-Zahl von 68% auf 67% fällt. Das ist kein Widerspruch, da beide Kennzahlen Unterschiedliches messen. In diesem kleinen Test verbessert sich 2.1, bleibt bei komplexer Befolgung aber hinter dem stärksten geschlossenen Modell.

Die offiziellen 60.28 und unabhängigen 7 / 15 lassen sich wegen anderer Aufgaben und Bewertung nicht zu einer Tabelle verschmelzen.

Native 2K, RGBA und Bildbearbeitung

Diffusers nutzt standardmäßig 2048x2048 und 40 Denoising-Schritte. Empfohlen werden unter anderem 2400x1792 für 4:3, 1792x2400 für 3:4, 2752x1536 für 16:9 und 1536x2752 für 9:16.

„Nativ 2K“ bezeichnet die Ziel-Arbeitsfläche. Es garantiert weder perfekte kleine Schrift noch exakte Objektzahlen oder mehr semantische Details. Auflösung und Prompt-Treue sind getrennte Tests.

Editing unterstützt bis zu zehn Referenzen in Diffusers, Identitätserhalt für Menschen und Produkte, Kreise oder gemalte Markierungen, separate Masken, Freistellung und transparente Layer. Für RGBA empfiehlt Qwen, Alphakanal und transparenten Hintergrund explizit zu verlangen und als PNG zu speichern; JPEG kann Alpha nicht erhalten.

VRAM-Anforderungen von Qwen-Image-2.1

KomponenteUngefähre Dateigröße
Qwen3-VL Text-/Bildencoder17.5 GB
DiT Transformer14.2 GB
RGBA VAE1.4 GB
Gesamt33.1 GB

Dateigröße ist nicht gleich Peak-VRAM, doch der offizielle BF16-Pfad mit .to("cuda") ist keine bequeme 24-GB-Konfiguration. vLLM-Omni maß auf einer NVIDIA GB300 bei 1024x1024 und 40 Schritten:

KonfigurationPeak-SpeicherZeit pro Bild
BF1634.0 GB3.28-4.49 s
DiT FP8, sensibles img_mlp in BF1632.0-32.7 GB3.36-4.71 s
Textencoder FP827.5-28.1 GB3.43-4.77 s

Das sind GB300-Messungen bei 1024px, keine RTX-3090/4090- oder Standard-2K-Werte. FP8 sparte vor allem Speicher und war nicht schneller. 24 GB können mit Quantisierung, CPU-Offload, VAE-Tiling oder Community-ComfyUI-Workflows funktionieren; dies ist aber ein Optimierungsprojekt statt einer zugesicherten Baseline.

Lokale Installation mit Diffusers

Der Quick Start installiert Diffusers direkt aus Git. Für reproduzierbare Tests sollten virtuelle Umgebung und getesteter Commit festgeschrieben werden.

bash
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt='A museum poster that reads "NATIVE RGBA", precise typography',
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("qwen-image-2-1.png")

Mehrere Referenzen werden als image=[...] übergeben. Seed, vollständiger Prompt, Runtime-Commit, Präzision, Auflösung und Schrittzahl gehören ins Testprotokoll; sonst ist ein Qualitätsvergleich nicht reproduzierbar.

ComfyUI und Serving

ComfyUI bietet nativen Support und offizielle JSON-Workflows für Generierung und Bearbeitung. Es ist bequem für visuelle Experimente und Community-Offload, während Diffusers kontrollierte Python-Tests erleichtert. vLLM-Omni und SGLang zielen auf Serving, Batching, Cache und FP8. Setzen Sie 40 Schritte explizit und prüfen Sie das Referenzlimit der konkreten Runtime.

Lizenz und kommerzielle Nutzung

Die veröffentlichte Lizenz erlaubt keine kommerzielle Nutzung. Die Qwen Research License definiert Non-Commercial als Forschung oder Evaluation und gewährt Nutzung, Änderung und Verteilung nur für nichtkommerzielle Zwecke.

NutzungAussage der veröffentlichten Lizenz
Interne Forschung/EvaluationUnter den Vertragsbedingungen erlaubt
Weitergabe von Gewichten/AbleitungenNichtkommerzieller Rahmen und Hinweise gelten
Bezahlprodukt oder kommerzieller DienstSeparate kommerzielle Lizenz erforderlich
Kontaktmodel-business@notice.qwencloud.com

Herunterladbare Gewichte bedeuten weder Apache-2.0 noch freie kommerzielle Nutzung. Wer generierte Assets verkauft oder das Modell in einen Bezahldienst integriert, sollte schriftliche Bedingungen und Rechtsberatung einholen, statt aus dem Wort „open-source“ im Launchpost Rechte abzuleiten.

Für wen lohnt sich das Modell?

Eine Evaluation lohnt sich, wenn native Transparenz den Freistellungsschritt spart, mehrere Personen oder Produkte referenziert werden, ein lokales Modell Erzeugung und Editing abdecken soll, mehr als 32 GB verfügbar sind oder Quantisierung/Offload akzeptabel ist und der Zweck tatsächlich nichtkommerzielle Forschung ist.

Warten Sie bei fehlender kommerzieller Lizenz, zwingendem Plug-and-play-2K auf 24 GB, höchster Prompt-Treue, Bedarf an reifen unabhängigen Daten oder wenn heute eine verwaltete Qwen-Image-2.1-API auf OmniaKey benötigt wird.

Für eine bereits verfügbare Bild-API vergleicht der Nano-Banana-2-vs-Pro-Test echte Generierungs- und Editing-Fälle. Der Modellkatalog ist maßgeblich für OmniaKey-Verfügbarkeit.

Grenzen dieses Tests

Wegen Demo-Auslastung wurde kein eigener Lauf abgeschlossen. Die visuellen Aussagen beruhen auf vier kuratierten offiziellen Bildern. Der unabhängige Test umfasst nur 15 Text-zu-Bild-Aufgaben und keine Transparenz oder Bearbeitung. Hardwarewerte stammen von GB200/GB300 statt Consumer-RTX. Dieser Beitrag ist technische Analyse, keine Rechtsberatung.

Häufige Fragen

Ist Qwen-Image-2.1 Open Source?

Code und Gewichte sind öffentlich herunterladbar und Qwen nennt das Modell open-source. Die Gewichte stehen jedoch unter einer kommerziell eingeschränkten Forschungslizenz. „Open Weight mit Forschungslizenz“ ist präziser als uneingeschränktes Open Source.

Wie viel VRAM braucht Qwen-Image-2.1?

Die Hauptdateien umfassen etwa 33.1 GB. vLLM-Omni maß 34.0 GB BF16 und 27.5-28.1 GB mit FP8-Textencoder auf GB300. Auflösung, Präzision, Offload, Runtime und GPU verändern das Ergebnis.

Läuft es auf RTX 3090 oder 4090?

Nicht mit dem vollständigen offiziellen BF16-.to("cuda")-Pfad. Quantisierung und Offload können 24 GB ermöglichen, doch offizielle Launchdaten belegen weder Geschwindigkeit noch native 2K-Stabilität auf diesen Karten.

Unterstützt Qwen-Image-2.1 ComfyUI?

Ja. ComfyUI lieferte am Releasetag nativen Support sowie offizielle Text-zu-Bild- und Bearbeitungsworkflows.

Wie viele Referenzbilder sind möglich?

Offizielles Diffusers unterstützt bis zu 10, aktuelles vLLM-Omni 4. Maßgeblich ist die eingesetzte Runtime.

Ist kommerzielle Nutzung erlaubt?

Nicht durch die veröffentlichte Qwen Research License. Eine separate Lizenz kann unter model-business@notice.qwencloud.com angefragt werden; klären Sie den konkreten Zweck rechtlich.

Ist Qwen-Image-2.1 auf OmniaKey verfügbar?

Nein, Stand 21. September 2026. Der Katalog enthält Qwen-Image-3-Routen, aber nicht Qwen/Qwen-Image-2.1. Dieser Test ist keine Verfügbarkeitsankündigung.

Primärquellen

Evidenz geprüft am 2026-09-21. Runtime, Grenzen und Lizenzoptionen können sich ändern; prüfen Sie vor Produktiventscheidungen erneut die Primärquellen.