250억 토큰 규모 Cosmopedia 공개
Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models
·2024.03.20 09:00
핵심 내용
HuggingFace가 LLM 사전 학습용 대규모 오픈 합성 데이터셋인 Cosmopedia를 공개했다.
자세히 보기
HuggingFace는 Microsoft의 Phi 모델과 같이 합성 데이터(Synthetic Data)를 활용해 고성능 LLM을 사전 학습할 수 있도록 돕는 Cosmopedia 데이터셋을 공개했다.
Cosmopedia는 Mixtral-8x7B-Instruct-v0.1을 사용하여 생성되었으며, 교과서, 블로그 포스트, 이야기, WikiHow 기사 등 다양한 형태의 콘텐츠를 포함한다.
- 규모: 3,000만 개 이상의 파일과 250억 개의 토큰으로 구성되어 있으며, 현재까지 공개된 합성 데이터셋 중 최대 규모다.
- 투명성: 데이터 생성 과정이 불투명한 기존 모델들과 달리, 데이터 생성 코드와 전체 파이프라인을 오픈소스로 제공한다.
- 결과물: 데이터셋뿐만 아니라 이를 통해 학습된 1B 규모의 모델인 cosmo-1b와 전체 파이프라인 코드를 함께 배포한다.
이번 공개는 대규모 합성 데이터를 활용해 모델을 처음부터(from scratch) 학습시키려는 연구자와 개발자들에게 중요한 자원이 될 것으로 보인다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.