Qwen-Image-Edit: 더 높은 품질과 효율의 이미지 편집
핵심 내용
Qwen-Image-Edit는 Qwen-Image의 텍스트 렌더링을 이미지 편집으로 확장한 20B 모델이다.
자세히 보기
Qwen-Image-Edit는 20B Qwen-Image를 기반으로 만든 이미지 편집 모델로, Qwen-Image의 강점이던 텍스트 렌더링 능력을 편집 작업까지 확장했다. 입력 이미지를 Qwen2.5-VL에 넣어 시각적 의미를 제어하고, VAE Encoder로 외형을 제어해 의미 편집과 외형 편집을 함께 지원한다.
핵심 기능은 크게 세 가지다.
- Semantic editing: 물체 회전, 스타일 변환, IP 캐릭터 생성처럼 전체 픽셀이 바뀌어도 의미 일관성을 유지하는 편집
- Appearance editing: 배경 변경, 의상 수정, 요소 추가·삭제처럼 특정 영역만 바꾸고 나머지는 그대로 유지하는 편집
- Precise text editing: 중국어와 영어 텍스트를 직접 추가·삭제·수정하면서 원래의 글꼴, 크기, 스타일을 최대한 보존하는 편집
예시에서는 캡바라 마스코트의 성격을 유지한 채 다양한 IP 이미지를 만들고, 90도 및 180도 회전을 통해 novel view synthesis를 수행하며, Studio Ghibli 스타일 같은 style transfer도 보여준다. 외형 편집에서는 간판을 추가한 뒤 반사까지 생성하고, 머리카락 같은 미세 요소를 제거하거나 특정 글자 색만 바꾸는 등 세밀한 조작이 가능하다.
텍스트 편집 성능도 강조한다. 영어 포스터의 문구를 정확히 바꾸고, 중국어 포스터에서는 큰 헤드라인뿐 아니라 작은 글자까지 수정할 수 있다. 마지막에는 Qwen-Image가 생성한 서예 작품의 오류를 bounding box로 영역별 지정해 단계적으로 교정하는 체인 편집 방식도 소개하며, 어려운 한자도 여러 번의 수정으로 바로잡을 수 있음을 보여준다.
결국 Qwen-Image-Edit는 이미지 생성의 허들을 낮추는 것을 목표로, 더 정교하고 효율적인 이미지 편집용 foundation model로 자리 잡겠다는 방향을 제시한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.