AI Briefing

HuggingFace, Open-R1 프로젝트 진행 상황 공개

Open-R1: Update #1

·2025.02.02 09:04

HuggingFace가 DeepSeek-R1의 학습 파이프라인과 데이터셋을 재현하는 Open-R1 프로젝트의 첫 번째 업데이트를 발표했다.

HuggingFace는 DeepSeek-R1의 핵심 요소인 학습 파이프라인과 **합성 데이터(Synthetic Data)**를 재현하기 위한 Open-R1 프로젝트의 진행 상황을 공유했다.

주요 성과 및 관찰 사항:

  • 벤치마크 재현: MATH-500 테스트를 통해 DeepSeek-R1 증류 모델들의 성능을 성공적으로 검증했다.
  • 긴 응답 길이 확인: R1 모델의 평균 응답 길이는 약 6,000 토큰에 달하며, 일부는 20,000 토큰을 초과한다. 이러한 긴 응답은 GRPO 학습 시 막대한 GPU 메모리를 요구하는 도전 과제가 된다.
  • GRPO 통합: TRL(v0.14) 라이브러리에 **GRPO(Grouped Relative Policy Optimization)**가 통합되었다. 이를 통해 DeepSpeed ZeRO 및 vLLM과 연동하여 대규모 병렬 학습이 가능해졌다.

Open-R1 프로젝트는 오픈 소스 커뮤니티가 고성능 추론 모델을 직접 구축하고 최적화할 수 있는 환경을 제공하는 것을 목표로 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.