Qwen-Image-2.0 기술 보고서
·2026.05.13 09:00
Qwen-Image-2.0은 생성·편집을 통합한 이미지 foundation model을 제시했다.
Qwen-Image-2.0은 생성과 편집을 하나로 묶은 image generation foundation model이다. 기존 모델이 취약했던 초장문 텍스트 렌더링, 다국어 타이포그래피, 고해상도 photorealism, 복잡한 instruction following, 효율적 배포를 동시에 겨냥했다.
핵심 구조는 Qwen3-VL을 condition encoder로 쓰고, Multimodal Diffusion Transformer로 condition-target를 함께 모델링하는 방식이다. 여기에 대규모 데이터 큐레이션과 맞춤형 multi-stage training pipeline을 붙여 이해력과 생성·편집 유연성을 함께 끌어올렸다.
최대 1K tokens의 instruction을 받아 슬라이드, 포스터, 인포그래픽, 만화처럼 텍스트 비중이 큰 콘텐츠를 생성할 수 있다. 다국어 텍스트 충실도와 타이포그래피가 개선됐고, 질감·조명·디테일도 더 사실적으로 표현됐다.
- 복잡한 프롬프트를 더 안정적으로 따른다.
- 인간 평가에서 이전 Qwen-Image 모델보다 생성과 편집 모두에서 우수했다.
- 더 일반적이고 신뢰할 수 있는 실용 모델로 가는 방향을 보여줬다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.