AI Briefing

초경량 VLM SmolVLM 256M/500M 공개

SmolVLM Grows Smaller – Introducing the 256M & 500M Models!

·2025.01.23 09:00

핵심 내용

HuggingFace가 초경량 멀티모달 모델인 SmolVLM 256M 및 500M 모델을 출시했다.

자세히 보기

HuggingFace가 기존 SmolVLM 2B를 넘어선 초경량 Vision Language Model(VLM)인 SmolVLM-256M과 SmolVLM-500M을 발표했다.

SmolVLM-256M은 2억 5,600만 개의 파라미터를 가진 세계에서 가장 작은 VLM으로, 이미지 캡셔닝, 문서 Q&A, 기초적인 시각적 추론 작업이 가능하다. SmolVLM-500M은 성능과 효율성 사이의 균형을 맞춘 모델로, DocVQA 및 MMMU 등에서 더 높은 성능을 제공하며 프롬프트에 대한 견고함이 개선되었다.

주요 기술적 특징은 다음과 같다:

  • SigLIP base patch-16/512 비전 인코더 채택을 통한 효율성 증대
  • 더 큰 이미지 해상도 처리를 통한 정밀한 이미지 이해력 확보
  • 새로운 토큰화 기법을 통한 실질적인 벤치마크 성능 향상

이 모델들은 Transformers, MLX, ONNX를 통해 즉시 로드 가능하며, WebGPU를 활용한 브라우저 기반 추론도 지원한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.