AI Briefing

VLM 기술 트렌드 및 최신 모델 동향 정리

Vision Language Models (Better, faster, stronger)

·2025.05.12 09:00

지난 1년간 급변한 Vision Language Model(VLM)의 주요 기술 트렌드와 최신 모델 및 벤치마크를 정리했다.

지난 1년간 Vision Language Model(VLM) 분야는 모델의 소형화, 추론 능력 강화, 그리고 멀티모달 에이전트로의 진화 등 급격한 발전을 이루었다.

주요 모델 트렌드

  • Any-to-any 모델: 텍스트, 이미지, 오디오 등 다양한 모달리티를 자유롭게 입출력하는 모델(Qwen 2.5 Omni, MiniCPM-o 2.6)이 등장했다.
  • 소형화 및 효율화: 성능은 유지하면서 크기를 줄인 Smol 모델Mixture-of-Experts(MoE) 구조를 채택한 디코더 모델이 주목받고 있다.
  • VLA(Vision Language Action) 모델: 시각 정보를 바탕으로 직접적인 행동을 수행하는 모델로 확장되고 있다.

특화 기능 및 응용

  • 멀티모달 RAG: 이미지와 텍스트를 동시에 검색하고 재순위화(Reranking)하는 기술이 발전했다.
  • 객체 탐지 및 분할: VLM을 활용한 정교한 객체 탐지(Detection)와 세그멘테이션(Segmentation) 기능이 강화되었다.
  • 멀티모달 에이전트 및 비디오 이해: 단순 이미지 이해를 넘어 비디오 분석과 복잡한 작업을 수행하는 에이전트 기술이 핵심 과제로 떠올랐다.

벤치마크 및 정렬

  • MMT-Bench, MMMU-Pro와 같은 새로운 벤치마크가 등장하여 모델의 성능을 더욱 정밀하게 평가한다.
  • 멀티모달 안전성(Safety)을 위한 새로운 정렬(Alignment) 기술도 지속적으로 연구되고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.