OpenR1-Math-220k 데이터셋 공개
Open R1: Update #2
·2025.02.11 01:10
HuggingFace가 DeepSeek R1의 추론 능력을 재현하기 위한 수학 추론 데이터셋 OpenR1-Math-220k를 공개했다.
HuggingFace의 Open R1 프로젝트가 DeepSeek R1의 학습 파이프라인과 합성 데이터를 재구성하기 위한 첫 번째 대규모 수학 추론 데이터셋인 OpenR1-Math-220k를 발표했다.
데이터셋 주요 특징:
- 220k 고품질 데이터: NuminaMath 1.5를 기반으로 하며, 정답이 검증된 22만 개의 수학 문제와 추론 과정을 포함한다.
- H100 기반 로컬 생성: API를 사용하지 않고 512개의 H100 GPU를 활용해 로컬에서 직접 생성했다. 특히 SGLang을 도입하여 vLLM 대비 약 2배 빠른 생성 속도를 확보했다.
- 정교한 필터링:
Math Verify와Llama3.3-70B-Instruct를 사용하여 규칙 기반 파서로 검증하기 어려운 사례까지 포함해 데이터 품질을 높였다.
해당 데이터셋으로 Qwen-7B-Math-Instruct를 파인튜닝한 결과, DeepSeek-Distill-Qwen-7B와 대등한 수준의 성능을 달성하며 데이터의 유효성을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.