Qwen, 7B 파라미터 통합 이미지 모델 'Qwen-Image-2.1' 공개
핵심 내용
Qwen이 생성과 편집을 통합한 7B 파라미터의 오픈소스 이미지 모델 Qwen-Image-2.1을 공개했다.
자세히 보기
Qwen 팀이 텍스트-이미지 생성과 이미지 편집 기능을 하나로 통합한 오픈소스 모델 Qwen-Image-2.1을 공개했다. 시각 생성 컴포넌트 파라미터가 7B에 불과한 컴팩트한 아키텍처를 채택해 생성 품질과 추론 효율, 비용 간의 균형을 맞춘 것이 특징이다.
효율적인 아키텍처와 투명도 지원
모델은 32개의 Single-Stream DiT 레이어로 구성되며, mixed-granularity attention 기법을 적용해 추론 속도를 높였다. 텍스트에는 token-level causal mask를, 이미지 생성에는 chunk-level mask를 사용하여 KV cache를 재사용함으로써 메모리 사용량을 줄였다. 또한 기존 전용 모델(Qwen-Image-Layered)의 기능을 통합해 프롬프트에 따라 투명 배경(RGBA) 이미지 생성 및 편집을 네이티브로 지원한다.
유연한 편집 기능
최대 10장의 참조 이미지를 결합해 그룹 사진이나 의상 조합, 인테리어 배치 등을 생성할 수 있다. 지역 편집(Local Editing) 시 원형, 페인트 주석, 별도 마스크를 활용해 특정 영역만 정밀하게 수정할 수 있으며, 인물 초상화의 얼굴 특징이나 제품의 질감 등 **충실도(Fidelity)**를 유지하는 데 강점을 보인다. 파노라마, 인포그래픽, 스토리보드 등 다양한 시각적 스토리텔링 작업에도 활용 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.