Qwen2.5-VL-32B: 더 똑똑하고 가벼워진 모델
·2025.03.24 01:00
Qwen이 강화학습으로 성능을 최적화한 32B 규모의 오픈소스 멀티모달 모델 Qwen2.5-VL-32B-Instruct를 공개했다.
Qwen이 강화학습(Reinforcement Learning)을 통해 최적화된 Qwen2.5-VL-32B-Instruct를 Apache 2.0 라이선스로 공개했다. 이 모델은 기존 Qwen2.5-VL 시리즈를 기반으로 하며, 32B 파라미터 규모를 유지하면서도 성능을 대폭 끌어올린 것이 특징이다.
주요 개선 사항은 다음과 같다:
- 인간 선호도 정렬: 답변 스타일을 조정하여 더 상세하고 형식이 잘 갖춰진 답변을 제공한다.
- 수학적 추론: 복잡한 수학 문제 해결 능력이 크게 향상되었다.
- 세밀한 이미지 이해: 이미지 파싱, 콘텐츠 인식, 시각적 논리 추론 등에서 정확도와 분석 능력이 강화되었다.
벤치마크 결과, Qwen2.5-VL-32B-Instruct는 Mistral-Small-3.1-24B 및 Gemma-3-27B-IT와 같은 동급 모델을 능가하며, 심지어 더 큰 모델인 Qwen2-VL-72B-Instruct보다 뛰어난 성능을 보여주었다. 특히 MMMU, MMMU-Pro, MathVista와 같은 복잡한 다단계 추론 중심의 멀티모달 태스크에서 압도적인 우위를 점했다.
또한 주관적 사용자 경험을 평가하는 MM-MT-Bench에서도 이전 세대인 72B 모델을 크게 앞질렀으며, 시각적 능력뿐만 아니라 동일 규모의 순수 텍스트 처리 능력에서도 최상위권 성능을 기록했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.