AI Briefing

250억 토큰 규모 Cosmopedia 공개

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

·2024.03.20 09:00

핵심 내용

HuggingFace가 LLM 사전 학습용 대규모 오픈 합성 데이터셋인 Cosmopedia를 공개했다.

자세히 보기

HuggingFace는 Microsoft의 Phi 모델과 같이 합성 데이터(Synthetic Data)를 활용해 고성능 LLM을 사전 학습할 수 있도록 돕는 Cosmopedia 데이터셋을 공개했다.

Cosmopedia는 Mixtral-8x7B-Instruct-v0.1을 사용하여 생성되었으며, 교과서, 블로그 포스트, 이야기, WikiHow 기사 등 다양한 형태의 콘텐츠를 포함한다.

  • 규모: 3,000만 개 이상의 파일과 250억 개의 토큰으로 구성되어 있으며, 현재까지 공개된 합성 데이터셋 중 최대 규모다.
  • 투명성: 데이터 생성 과정이 불투명한 기존 모델들과 달리, 데이터 생성 코드와 전체 파이프라인을 오픈소스로 제공한다.
  • 결과물: 데이터셋뿐만 아니라 이를 통해 학습된 1B 규모의 모델인 cosmo-1b와 전체 파이프라인 코드를 함께 배포한다.

이번 공개는 대규모 합성 데이터를 활용해 모델을 처음부터(from scratch) 학습시키려는 연구자와 개발자들에게 중요한 자원이 될 것으로 보인다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.