Qwen2-VL: 세상을 더 명확하게 이해하다
·2024.08.29 01:24
핵심 내용
Qwen 모델 시리즈의 최신 시각 언어 모델인 Qwen2-VL이 공개되어 영상 이해와 Agent 기능을 강화했다.
자세히 보기
Qwen 모델 시리즈의 최신 버전인 Qwen2-VL이 출시되었다. 이 모델은 다양한 해상도와 비율의 이미지를 이해하는 것은 물론, 20분 이상의 긴 영상도 고품질로 분석할 수 있는 능력을 갖췄다.
특히 복잡한 추론과 의사결정 능력을 바탕으로 모바일 기기나 로봇을 직접 조작하는 Agent로 활용이 가능하다. 또한 한국어를 포함한 다양한 다국어 텍스트를 이미지 내에서 인식할 수 있다.
모델 라인업은 다음과 같다:
- Qwen2-VL-72B: GPT-4o 및 Claude 3.5-Sonnet을 능가하는 성능을 보여주며, 특히 문서 이해 분야에서 강력한 강점을 가진다. (API 제공)
- Qwen2-VL-7B: 이미지, 멀티 이미지, 영상 입력을 모두 지원하며 가성비 높은 성능을 제공한다. (Apache 2.0 오픈소스)
- Qwen2-VL-2B: 모바일 배포에 최적화된 소형 모델로, 크기 대비 뛰어난 영상 및 문서 이해력을 자랑한다. (Apache 2.0 오픈소스)
이번 오픈소스 모델은 Hugging Face Transformers, vLLM 등 주요 프레임워크와 통합되어 즉시 사용 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.