AI Briefing

Qwen2.5-VL 공개!

·2025.01.26 20:08

핵심 내용

Qwen이 에이전트 기능과 긴 영상 이해력을 갖춘 차세대 시각-언어 모델 Qwen2.5-VL을 공개했다.

자세히 보기

Qwen이 이전 버전인 Qwen2-VL에서 크게 도약한 차세대 플래그십 시각-언어 모델(VLM)인 Qwen2.5-VL을 출시했다. 이번 모델은 3B, 7B, 72B 세 가지 크기의 Base 및 Instruct 모델로 제공된다.

주요 특징은 다음과 같다:

  • 시각적 이해력: 일반 사물 인식은 물론 텍스트, 차트, 아이콘, 레이아웃 분석에 능숙하다.
  • 에이전트 기능: 컴퓨터 및 스마트폰 사용이 가능한 시각적 에이전트로서 도구를 동적으로 제어하고 추론할 수 있다.
  • 장기 영상 이해: 1시간 이상의 긴 영상도 이해하며, 특정 이벤트를 정확히 짚어내는 능력을 갖췄다.
  • 정밀한 로컬라이제이션 및 구조화된 출력: 바운딩 박스나 포인트로 객체를 정확히 위치시키며, 인보이스나 표 같은 데이터를 JSON 형식의 구조화된 데이터로 변환할 수 있다.

성능 면에서 Qwen2.5-VL-72B-Instruct는 수학, 문서 이해, 비디오 이해 등 다양한 벤치마크에서 SOTA 모델들과 경쟁할 만한 성능을 보여준다. 특히 문서와 도표 이해에서 큰 강점을 보이며, 별도의 미세 조정 없이도 시각적 에이전트 역할을 수행할 수 있다.

중소형 모델의 경우, Qwen2.5-VL-7B-Instruct는 여러 작업에서 GPT-4o-mini를 능가한다. 엣지 AI를 위한 3B 모델은 이전 버전인 Qwen2-VL 7B 모델보다 뛰어난 성능을 기록했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.