AI Briefing

Qwen-VL 소개

·2024.01.25 14:33

Qwen이 이미지 추론 및 인식 능력을 대폭 강화한 멀티모달 모델 Qwen-VL-Plus와 Qwen-VL-Max를 공개했다.

Qwen의 멀티모달 능력을 확장한 Qwen-VL 시리즈가 Qwen-VL-PlusQwen-VL-Max라는 두 가지 강화된 버전으로 업그레이드되었다. 이번 업데이트는 이미지 관련 추론 능력과 이미지 내 텍스트 및 세부 정보의 인식, 추출, 분석 능력을 대폭 향상시켰다.

특히 100만 픽셀 이상의 고해상도 이미지와 다양한 화면 비율을 지원하는 것이 특징이다.

  • qwen-vl-plus: 세부 인식 및 텍스트 인식 능력이 강화된 모델로, 초고해상도 이미지와 임의의 화면 비율을 지원한다.
  • qwen-vl-max: 가장 강력한 성능을 가진 모델로, 시각적 추론과 지시 이행(instruction-following) 능력이 더욱 개선되어 복잡한 작업에서 최적의 성능을 제공한다.

성능 면에서 이 모델들은 여러 멀티모달 작업에서 Gemini UltraGPT-4V와 대등한 수준을 보여주며, 기존 오픈소스 모델의 기록을 크게 경신했다. 특히 중국어 질의응답 및 텍스트 이해 작업에서는 GPT-4VGemini를 능가하는 성과를 거두었다.

실생활에서도 대화, 유명인 및 랜드마크 식별, 텍스트 생성, 시각적 콘텐츠 해석 등에서 뛰어난 문제 해결 능력을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.