HuggingFace, SmolLM 공개
SmolLM - blazingly fast and remarkably powerful
·2024.07.16 09:00
HuggingFace가 고품질 데이터로 학습된 135M, 360M, 1.7B 규모의 소형 언어 모델 SmolLM 시리즈를 공개했다.
HuggingFace가 로컬 기기에서 효율적으로 작동할 수 있도록 설계된 최첨단 소형 언어 모델(SLM) 시리즈인 SmolLM을 발표했다. SmolLM은 135M, 360M, 1.7B 파라미터의 세 가지 크기로 제공된다.
이번 모델의 핵심은 정교하게 큐레이션된 고품질 학습 데이터셋인 SmolLM-Corpus에 있다. 이 데이터셋은 다음과 같이 구성된다:
- Cosmopedia v2: Mixtral을 통해 생성된 28B 토큰 규모의 합성 교과서 및 스토리 데이터셋
- Python-Edu: The Stack에서 추출한 4B 토큰 규모의 교육용 Python 샘플
- FineWeb-Edu: FineWeb에서 추출한 220B 토큰 규모의 교육용 웹 샘플
SmolLM은 상식 추론 및 세계 지식 벤치마크에서 동일 체급의 다른 모델들을 압도하는 성능을 보여준다. HuggingFace는 모델뿐만 아니라 학습에 사용된 데이터셋 전체를 오픈 소스로 공개하여, 소형 모델의 성능을 높이기 위한 데이터 큐레이션의 중요성을 강조했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.