AI Briefing

Qwen-Image: 네이티브 텍스트 렌더링으로 만드는 이미지 창작

·2025.08.04 23:08

핵심 내용

Qwen-Image는 복잡한 텍스트 렌더링과 정밀 편집에 강한 20B 이미지 모델이다.

1 / 2

자세히 보기

Qwen-Image가 20B MMDiT 기반 이미지 foundation model로 공개됐다. 핵심은 복잡한 문장과 레이아웃을 자연스럽게 렌더링하는 능력과, 편집 시 의미와 시각적 현실감을 함께 유지하는 정밀성이다.

주요 특징은 다음과 같다.

  • Superior Text Rendering: 영어 같은 알파벳 문자뿐 아니라 중국어 같은 표의 문자까지, 멀티라인 레이아웃과 문단 수준의 텍스트를 높은 정확도로 생성한다.
  • Consistent Image Editing: 확장된 멀티태스크 학습으로 스타일 변환, 추가/삭제, 디테일 보강, 텍스트 편집, 포즈 조정 같은 편집 작업에서 일관성을 높였다.
  • Strong Cross-Benchmark Performance: 일반 생성과 편집 벤치마크 전반에서 기존 모델을 앞서는 성능을 보였다.

평가 결과도 강하다. GenEval, DPG, OneIG-Bench에서는 일반 이미지 생성 성능을 검증했고, GEdit, ImgEdit, GSO에서는 편집 능력을 확인했다. 텍스트 렌더링에서는 LongText-Bench, ChineseWord, TextCraft에서 특히 강점을 보이며, 중국어 텍스트 생성에서 눈에 띄는 우위를 보여줬다.

데모에서는 중국어 간판, 대련, 긴 문단, 이중언어 문구, 포스터, PPT까지 다양한 사례를 보여준다. 짧은 글부터 긴 설명문까지 자연스럽게 배치하고, 영어와 중국어를 한 화면 안에서 전환하며, 작은 종이 위의 문장이나 유리판 손글씨도 비교적 정확하게 재현한다.

텍스트에 강한 만큼 활용 범위도 넓다. 포스터, 슬라이드, 브랜드 시안 같은 콘텐츠 제작은 물론, 일반적인 예술 스타일 생성과 이미지 편집까지 아우르는 범용 이미지 모델로 자리매김하겠다는 방향을 제시한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.