HuggingFace, 초경량 비디오 이해 모델 SmolVLM2 공개
SmolVLM2: Bringing Video Understanding to Every Device
·2025.02.20 09:00
HuggingFace가 비디오 이해 능력을 갖춘 초경량 멀티모달 모델 SmolVLM2 시리즈를 공개했다.
HuggingFaceTB에서 비디오 이해 기능을 갖춘 초경량 멀티모달 모델인 SmolVLM2를 출시했다. 이번 시리즈는 2.2B, 500M, 256M 세 가지 크기로 제공되며, 특히 500M와 256M 모델은 역대 가장 작은 규모의 비디오 언어 모델이다.
SmolVLM2 2.2B 모델은 기존 SmolVLM 대비 이미지 내 수학 문제 풀이, 텍스트 읽기, 복잡한 다이어그램 및 과학적 시각 질문 이해 능력이 크게 향상되었다. 비디오 성능 측면에서는 Video-MME 벤치마크에서 2B 규모의 모델 중 최고 수준의 성능을 기록하며 효율성을 입증했다.
주요 특징은 다음과 같다:
- 높은 효율성: 메모리 소비량 대비 성능이 매우 뛰어나 모바일 기기부터 서버까지 다양한 환경에서 구동 가능하다.
- MLX 지원: 출시와 동시에 Python 및 Swift API를 통한 MLX 환경을 지원하여 Apple 기기에서의 활용성을 높였다.
- 다양한 활용성: 비디오 하이라이트 생성, VLC 미디어 플레이어 통합 등 다양한 데모 애플리케이션을 지원한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.