HuggingFace, SmolLM 공개
SmolLM - blazingly fast and remarkably powerful
·2024.07.16 09:00
핵심 내용
HuggingFace가 고품질 데이터로 학습된 135M, 360M, 1.7B 규모의 소형 언어 모델 SmolLM 시리즈를 공개했다.
1 / 2
자세히 보기
HuggingFace가 로컬 기기에서 효율적으로 작동할 수 있도록 설계된 최첨단 소형 언어 모델(SLM) 시리즈인 SmolLM을 발표했다. SmolLM은 135M, 360M, 1.7B 파라미터의 세 가지 크기로 제공된다.
이번 모델의 핵심은 정교하게 큐레이션된 고품질 학습 데이터셋인 SmolLM-Corpus에 있다. 이 데이터셋은 다음과 같이 구성된다:
- Cosmopedia v2: Mixtral을 통해 생성된 28B 토큰 규모의 합성 교과서 및 스토리 데이터셋
- Python-Edu: The Stack에서 추출한 4B 토큰 규모의 교육용 Python 샘플
- FineWeb-Edu: FineWeb에서 추출한 220B 토큰 규모의 교육용 웹 샘플
SmolLM은 상식 추론 및 세계 지식 벤치마크에서 동일 체급의 다른 모델들을 압도하는 성능을 보여준다. HuggingFace는 모델뿐만 아니라 학습에 사용된 데이터셋 전체를 오픈 소스로 공개하여, 소형 모델의 성능을 높이기 위한 데이터 큐레이션의 중요성을 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.