AI Briefing

Qwen-VL 소개

·2024.01.25 14:33

핵심 내용

Qwen이 이미지 추론 및 인식 능력을 대폭 강화한 멀티모달 모델 Qwen-VL-Plus와 Qwen-VL-Max를 공개했다.

자세히 보기

Qwen의 멀티모달 능력을 확장한 Qwen-VL 시리즈가 Qwen-VL-Plus와 Qwen-VL-Max라는 두 가지 강화된 버전으로 업그레이드되었다. 이번 업데이트는 이미지 관련 추론 능력과 이미지 내 텍스트 및 세부 정보의 인식, 추출, 분석 능력을 대폭 향상시켰다.

특히 100만 픽셀 이상의 고해상도 이미지와 다양한 화면 비율을 지원하는 것이 특징이다.

  • qwen-vl-plus: 세부 인식 및 텍스트 인식 능력이 강화된 모델로, 초고해상도 이미지와 임의의 화면 비율을 지원한다.
  • qwen-vl-max: 가장 강력한 성능을 가진 모델로, 시각적 추론과 지시 이행(instruction-following) 능력이 더욱 개선되어 복잡한 작업에서 최적의 성능을 제공한다.

성능 면에서 이 모델들은 여러 멀티모달 작업에서 Gemini Ultra 및 GPT-4V와 대등한 수준을 보여주며, 기존 오픈소스 모델의 기록을 크게 경신했다. 특히 중국어 질의응답 및 텍스트 이해 작업에서는 GPT-4V와 Gemini를 능가하는 성과를 거두었다.

실생활에서도 대화, 유명인 및 랜드마크 식별, 텍스트 생성, 시각적 콘텐츠 해석 등에서 뛰어난 문제 해결 능력을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.