HuggingFace, 2B 소형 VLM 'SmolVLM' 공개
SmolVLM - small yet mighty Vision Language Model
·2024.11.26 09:00
핵심 내용
HuggingFace가 메모리 효율성을 극대화한 2B 규모의 오픈소스 시각 언어 모델 SmolVLM을 공개했다.
자세히 보기
HuggingFaceTB에서 개발한 SmolVLM은 2B 파라미터 규모의 소형 시각 언어 모델(VLM) 제품군이다. 로컬 환경, 브라우저, 엣지 디바이스 배포를 목표로 설계되었으며, 메모리 효율성과 추론 속도가 매우 뛰어나다.
모델은 용도에 따라 세 가지 버전으로 제공된다:
- SmolVLM-Base: 다운스트림 미세 조정(Fine-tuning)을 위한 베이스 모델.
- SmolVLM-Synthetic: 합성 데이터로 미세 조정된 모델.
- SmolVLM-Instruct: 대화형 애플리케이션에 즉시 사용 가능한 지시 이행 모델.
모든 모델 체크포인트, 데이터셋, 학습 레시피 및 도구는 Apache 2.0 라이선스로 공개되어 상업적 이용이 가능하다. The Cauldron 및 Docmatix와 같은 오픈소스 데이터셋을 활용해 학습되었으며, Transformers 라이브러리에 통합되어 있어 즉시 활용할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.