AI Briefing

OlympicCoder 및 신규 코딩 데이터셋 공개

Open R1: Update #3

·2025.03.12 05:40

Open R1 팀이 Claude 3.7 Sonnet을 능가하는 코딩 성능의 OlympicCoder 모델과 신규 데이터셋을 공개했다.

Open R1 팀이 DeepSeek-R1의 코딩 추론 능력을 재현하기 위한 세 번째 업데이트를 발표했다. 이번 업데이트의 핵심은 고성능 코딩 모델인 OlympicCoder와 이를 학습시킨 CodeForces-CoTs 데이터셋, 그리고 새로운 IOI 벤치마크다.

주요 성과:

  • CodeForces-CoTs 데이터셋: DeepSeek-R1을 통해 증류(distillation)한 약 10만 개의 고품질 C++ 및 Python CoT(Chain-of-Thought) 샘플을 포함한다.
  • OlympicCoder 모델: CodeForces-CoTs 데이터셋으로 미세 조정된 7B 및 32B 모델이다. 특히 32B 모델은 IOI(국제 정보 올림피아드) 문제에서 Claude 3.7 Sonnet과 같은 폐쇄형 모델을 능가하는 성능을 보였다.
  • IOI 벤치마크: 2024년 국제 정보 올림피아드(IOI)의 도전적인 문제들을 활용한 새로운 벤치마크를 도입했다.

또한, 기존 코딩 데이터셋들이 실제 대회에서 사용되는 전체 테스트 케이스를 포함하지 못해 발생하는 코드 검증성 위기(Code verifiability crisis) 문제를 지적하며, 더 정교한 검증 환경의 필요성을 강조했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.