Qwen VLo: ‘이해’에서 ‘표현’으로
·2025.06.26 23:00
핵심 내용
Qwen VLo는 이미지 이해와 생성을 하나로 묶은 멀티모달 모델이다.
자세히 보기
Qwen VLo는 이미지 내용을 이해하는 기존 멀티모달 모델을 넘어, 그 이해를 바탕으로 이미지를 직접 생성하고 수정하는 통합 멀티모달 이해·생성 모델이다. 현재는 preview 버전으로, Qwen Chat에서 사용할 수 있다.
생성 방식은 왼쪽에서 오른쪽, 위에서 아래로 이미지를 점진적으로 구성하는 progressive generation을 사용한다. 이 방식은 예측을 계속 다듬어 일관성과 조화로운 결과물을 높이고, 사용자가 더 세밀하게 결과를 제어할 수 있게 한다.
핵심은 이해 능력과 생성 능력이 함께 강화됐다는 점이다. 이전 모델들이 자주 겪던 의미 왜곡이나 구조 손실을 줄여, 예를 들어 자동차 사진의 색상 변경처럼 요청해도 차량의 모델과 형태를 최대한 보존한 채 자연스럽게 변환한다.
지원하는 작업도 넓다.
- 자연어로 하는 open-ended instruction editing: 스타일 변환, 장면 재구성, 세부 수정
- 전통적인 시각 과제: depth map, segmentation map, detection map, edge information 생성
- 복합 편집: 객체 수정, 텍스트 편집, 배경 변경을 한 번에 처리
또한 Chinese와 English를 포함한 multilingual instruction support를 제공해, 언어에 상관없이 동일한 방식으로 요청할 수 있다. 기사에는 강아지, 카툰, 실사, 포스터, 감지·분할 결과 등 다양한 데모가 제시되며, Qwen VLo가 단순 생성기를 넘어 이해를 바탕으로 재해석하고 재구성하는 도구임을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.