Qwen-Image-2.1 리뷰
네이티브 RGBA와 다중 참조 이미지 편집은 강력하지만, 연구 전용 라이선스와 약 28~34 GB의 실사용 메모리 하한 때문에 상업용 기본 모델보다는 평가용에 가깝습니다.
이 Qwen-Image-2.1 리뷰의 결론은 분명합니다. 네이티브 RGBA 출력과 생성·편집을 하나로 합친 파이프라인은 보기 드문 장점입니다. 반면 공개 가중치는 비상업적 연구 라이선스를 사용하고, 핵심 파일만 약 33.1 GB입니다. 단순히 “7B라서 RTX 3090에서 쉽게 실행된다”고 말할 수 없습니다.
투명 제품 에셋, 스티커, 피사체 추출, 여러 참조 이미지 합성을 연구한다면 시험할 가치가 큽니다. 유료 이미지 제품에 바로 넣으려면 별도 상업 라이선스와 하드웨어 계획이 먼저입니다.
2026년 9월 21일 사실 확인. 공식 출시 글, 저장소, Hugging Face 파일, 라이선스, Diffusers·ComfyUI 안내, vLLM-Omni 레시피, Qwen 공식 벤치마크와 독립 GenAI Image Showdown을 확인했습니다. 공식 샘플 4개의 원본도 내려받아 검사했습니다. 공개 Hugging Face Demo가 혼잡해 새 사용자 지정 생성은 완료되지 않았으므로, 이 글은 근거 중심의 출시 리뷰이며 자체 벤치마크라고 주장하지 않습니다. 공식 갤러리는 선별된 공급사 샘플입니다.
Qwen-Image-2.1 리뷰: 핵심 결론
| 질문 | 확인된 답변 |
|---|---|
| 어떤 모델인가 | 텍스트 이미지 생성과 이미지 편집을 통합한 Qwen/Qwen-Image-2.1 |
| 핵심 구조 | 7B 비주얼 생성기, 32개 Single-Stream DiT 레이어, Qwen3-VL 8B 인코더 |
| 해상도 | 네이티브 2K, 공식 Diffusers 기본값은 2048x2048 |
| 투명도 | 4채널 RGBA 생성 및 편집 네이티브 지원 |
| 참조 이미지 | 공식 파이프라인 최대 10장, 현재 vLLM-Omni는 4장 |
| 기본 샘플링 | 공식 Diffusers 예제는 40단계 |
| 로컬 크기 | 인코더·Transformer·VAE 가중치 약 33.1 GB, 런타임 오버헤드 제외 |
| 라이선스 | Qwen Research License, 비상업적 연구·평가 전용 |
| OmniaKey 제공 여부 | 2026-09-21 기준 카탈로그에 없음 |
시험할 가장 큰 이유는 순위가 아니라 실제 알파 투명도, 최대 10장 참조, 로컬 편집의 조합입니다. 바로 배포하지 말아야 할 이유 역시 라이선스, 메모리, 부족한 독립 평가로 구체적입니다.
Qwen-Image-2.1이란?
Qwen-Image-2.1은 2026년 9월 20일 출시됐습니다. 텍스트 이미지 생성, 단일 이미지 편집, 다중 이미지 합성, 마스크, 페인팅 표시, 투명 피사체 추출을 같은 파이프라인에서 처리합니다.
“7B”는 전체 로드 크기가 아니라 비주얼 생성 구성 요소를 뜻합니다.
- 비주얼 생성기: 7B 파라미터와 32개 Single-Stream DiT 레이어.
- 조건 인코더: 프롬프트와 참조 이미지를 함께 읽는 Qwen3-VL 8B.
- VAE: 64채널 잠재 구조, 16배 공간 압축, 4채널 입출력.
- 통합 작업: RGB/RGBA, 생성, 편집을 하나의 모델에서 처리.
출시 당일 Diffusers QwenImage21Pipeline, ComfyUI, vLLM-Omni, SGLang, LightX2V 지원이 발표됐습니다. 하지만 제한은 런타임마다 다릅니다. 공식 Diffusers 구성은 참조 10장을 지원하지만, 현재 vLLM-Omni는 다섯 번째 이미지를 거부합니다.
공식 샘플 원본에서 확인한 점
타이포그래피
포스터 샘플은 요청된 영어 두 줄을 모두 정확히 렌더링했고 글자 형태, 위계, 간격도 첫 시안으로 쓸 만했습니다. 다만 선별된 영어 포스터 한 장이 여러 언어와 여러 시드의 안정성을 증명하지는 않습니다.
6패널 스토리보드
출력은 정확히 6개 패널이었고 작은 로봇의 외형도 장면 사이에서 알아볼 수 있게 유지됐습니다. 패널 수와 캐릭터 일관성에는 긍정적이지만 세밀한 서사 연속성은 반복 시드 시험이 필요합니다.
제품 재질과 실제 투명 PNG
유리 제품 샘플은 굴절, 하이라이트, 표면 분리가 설득력 있었습니다. 투명 샘플 원본은 1664x2496 RGBA PNG였고 알파 범위가 0~255였습니다. RGB 이미지에 체크무늬를 그린 것이 아니라 완전 투명·불투명 픽셀이 모두 존재합니다.
연구용 라이선스를 고려해 이 상업 사이트에는 공식 이미지를 재게시하지 않고, 공식 갤러리 링크와 검증 가능한 파일 속성만 제공합니다.
Qwen-Image-2.1 벤치마크 해석
Qwen의 출시 차트에서 Qwen-Image-2.1은 Qwen-Image-Bench 60.28을 기록했습니다. 공식 평가 체계에서 경쟁력이 있다는 근거지만, 벤치마크·집계·평가 파이프라인이 모두 모델 제작자에게서 나왔으므로 독립 순위는 아닙니다.
독립 GenAI Image Showdown은 편집과 인페인팅을 금지한 15개 고난도 프롬프트 준수 과제를 시험합니다.
| 모델 | 통과 과제 | Compliance |
|---|---|---|
| OpenAI GPT-Image 2 | 12 / 15 | 98% |
| Ideogram 4 | 8 / 15 | 63% |
| Qwen-Image-2.1 | 7 / 15 | 67% |
| 기존 Qwen-Image | 4 / 15 | 68% |
2.1은 통과 수를 4에서 7로 높였지만 별도 compliance는 68%에서 67%로 바뀌었습니다. 두 지표가 다른 항목을 재므로 모순이 아닙니다. 이 작은 평가에서는 원본보다 개선됐지만 복잡한 지시 준수에서는 가장 강한 폐쇄형 모델에 뒤처졌다고 보는 것이 타당합니다.
공식 60.28과 독립 7 / 15는 과제와 채점 방식이 달라 하나의 순위로 합칠 수 없습니다.
네이티브 2K, RGBA, 이미지 편집
공식 Diffusers 기본값은 2048x2048, 디노이징 40단계입니다. 권장 크기는 1:1 2048x2048, 4:3 2400x1792, 3:4 1792x2400, 16:9 2752x1536, 9:16 1536x2752 등입니다.
네이티브 2K는 의도된 캔버스를 뜻할 뿐 작은 텍스트, 정확한 사물 수, 의미 세부가 자동으로 보장된다는 뜻은 아닙니다. 해상도와 프롬프트 준수는 따로 시험해야 합니다.
편집은 최대 10장 참조, 사람·제품 정체성 유지, 원이나 칠 표시를 이용한 로컬 지시, 별도 마스크, 피사체 추출, 투명 레이어 편집을 포함합니다. 투명 생성에는 RGBA, 알파 채널, 투명 배경을 프롬프트에 명시하고 PNG로 저장해야 합니다. JPEG는 알파를 보존하지 않습니다.
Qwen-Image-2.1 VRAM 요구 사항
공식 Hugging Face 파일의 규모는 다음과 같습니다.
| 구성 요소 | 대략적인 저장 크기 |
|---|---|
| Qwen3-VL 텍스트/비전 인코더 | 17.5 GB |
| DiT Transformer | 14.2 GB |
| RGBA VAE | 1.4 GB |
| 합계 | 33.1 GB |
파일 크기와 피크 VRAM은 같지 않지만 공식 BF16 .to("cuda") 경로가 편안한 24 GB 구성은 아닙니다. vLLM-Omni가 NVIDIA GB300 한 장, 1024x1024, 40단계에서 측정한 결과는 다음과 같습니다.
| 구성 | 피크 메모리 | 이미지당 시간 |
|---|---|---|
| BF16 | 34.0 GB | 3.28-4.49초 |
DiT FP8, 민감한 img_mlp는 BF16 | 32.0-32.7 GB | 3.36-4.71초 |
| 텍스트 인코더 FP8 | 27.5-28.1 GB | 3.43-4.77초 |
이는 GB300의 1024px 측정이며 RTX 3090/4090이나 기본 2K 결과가 아닙니다. FP8은 주로 메모리를 줄였고 이 시험에서는 속도를 높이지 않았습니다. 24 GB 카드도 양자화, CPU 오프로딩, VAE 타일링, 커뮤니티 ComfyUI 워크플로로 가능할 수 있지만 기준 구성이라기보다 최적화 프로젝트입니다.
Diffusers 로컬 설치
공식 빠른 시작은 출시 직후 Diffusers를 Git에서 설치합니다. 재현 가능한 배포라면 가상 환경과 검증한 커밋을 고정하십시오.
python -m pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
python -m pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt='A museum poster that reads "NATIVE RGBA", precise typography',
width=2048,
height=2048,
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("qwen-image-2-1.png")
여러 참조 이미지는 image=[...]로 전달합니다. 시드, 전체 프롬프트, 런타임 커밋, 정밀도, 해상도, 단계 수를 기록해야 품질 비교를 재현할 수 있습니다.
ComfyUI 지원
ComfyUI는 출시 당일 네이티브 지원과 공식 텍스트 이미지 생성·편집 workflow JSON을 제공했습니다. 시각적 실험과 커뮤니티 오프로딩에는 ComfyUI가 편하고, 통제된 Python 평가는 Diffusers가 명확합니다. vLLM-Omni와 SGLang은 서빙, 배치, 캐시, FP8용입니다. 40단계를 명시하고 각 런타임의 참조 이미지 한도를 확인하십시오.
라이선스: 상업적으로 사용할 수 있나?
공개 가중치 라이선스로는 불가능합니다. Qwen Research License는 Non-Commercial을 연구 또는 평가로만 정의하고, 자료의 사용·수정·배포를 비상업적 목적에만 허용합니다.
| 용도 | 공개 라이선스의 입장 |
|---|---|
| 내부 연구·평가 | 계약 조건에 따라 허용 |
| 가중치·파생물 재배포 | 비상업 범위와 고지 조건 적용 |
| 유료 제품·상업 서비스 | 별도 상업 라이선스 필요 |
| 문의 | model-business@notice.qwencloud.com |
가중치를 다운로드할 수 있다는 사실은 Apache-2.0 또는 자유로운 상업 이용을 뜻하지 않습니다. 생성물을 판매하거나 유료 서비스에 넣으려는 팀은 출시 글의 “open-source” 표현으로 권리를 추정하지 말고 서면 조건과 법률 검토를 받아야 합니다.
누구에게 맞고, 누가 기다려야 하나
투명 배경 제거 단계를 없애려는 연구, 여러 인물·제품·스타일 참조, 한 로컬 모델에서 생성과 편집을 모두 원하는 경우, 32 GB 이상 GPU 또는 양자화·오프로딩을 감수할 수 있는 경우에 평가할 가치가 있습니다.
상업 라이선스가 없거나, 바로 쓰는 24 GB 네이티브 2K 구성이 필요하거나, 엄격한 프롬프트 준수가 알파 출력보다 중요하거나, 성숙한 다국어 타이포그래피 데이터 또는 지금 당장 OmniaKey 관리 API가 필요하다면 기다리는 편이 낫습니다.
현재 제공 중인 이미지 API 비교는 Nano Banana 2와 Pro 리뷰를 참고하십시오. 실제 OmniaKey 제공 여부는 모델 카탈로그가 기준입니다.
이 리뷰의 한계
공개 Demo 혼잡으로 사용자 지정 생성이 완료되지 않았습니다. 시각 관찰은 4개의 선별된 공식 샘플에 한정됩니다. 독립 평가는 15개 텍스트 이미지 생성 과제뿐이며 편집과 투명도를 측정하지 않습니다. 하드웨어 값은 GB200/GB300에서 나온 것이고 소비자 RTX 측정이 아닙니다. 또한 이 글은 기술 분석이며 법률 자문이 아닙니다.
자주 묻는 질문
Qwen-Image-2.1은 오픈 소스인가요?
코드와 가중치는 공개 다운로드가 가능하고 Qwen은 open-source라고 표현합니다. 그러나 가중치는 상업 사용을 제한하는 Qwen Research License입니다. “제한 없는 오픈 소스”보다 “오픈 웨이트 연구 라이선스 모델”이 정확합니다.
Qwen-Image-2.1은 VRAM이 얼마나 필요한가요?
핵심 파일이 약 33.1 GB입니다. GB300의 vLLM-Omni 결과는 BF16 34.0 GB, 텍스트 인코더 FP8 27.5-28.1 GB였습니다. 해상도, 정밀도, 오프로딩, 런타임과 GPU에 따라 달라집니다.
RTX 3090 또는 4090에서 실행되나요?
공식 전체 BF16 .to("cuda") 경로는 24 GB에 맞지 않습니다. 양자화와 오프로딩으로 가능할 수 있지만, 출시 시점 공식 근거는 소비자 카드의 속도나 네이티브 2K 안정성을 보장하지 않습니다.
ComfyUI를 지원하나요?
예. 출시 당일 네이티브 지원과 공식 텍스트 이미지 생성·이미지 편집 워크플로가 나왔습니다.
참조 이미지는 몇 장까지인가요?
공식 Diffusers는 최대 10장, 현재 vLLM-Omni는 4장입니다. 실제 배포 런타임의 계약을 확인해야 합니다.
상업적으로 사용할 수 있나요?
공개 Qwen Research License는 상업 사용을 허용하지 않습니다. model-business@notice.qwencloud.com에 별도 라이선스를 문의하고 용도에 맞는 법률 검토를 받으십시오.
OmniaKey에서 사용할 수 있나요?
2026년 9월 21일 기준 아니요. OmniaKey에는 Qwen Image 3 계열이 있지만 Qwen/Qwen-Image-2.1은 없습니다. 이 글은 서비스 출시 공지가 아닙니다.
1차 출처
- Qwen 공식 출시 글
- 공식 저장소와 빠른 시작
- Qwen Research License
- Hugging Face 모델 파일
- ComfyUI 텍스트 이미지 workflow
- ComfyUI 이미지 편집 workflow
- vLLM-Omni 레시피
- Qwen-Image-Bench
- 독립 GenAI Image Showdown
근거는 2026-09-21에 확인했습니다. 런타임, 제한과 라이선스 옵션은 바뀔 수 있으므로 프로덕션 결정 전에 1차 출처를 다시 확인하십시오.