OlympicCoder 및 신규 코딩 데이터셋 공개
Open R1: Update #3
·2025.03.12 05:40
핵심 내용
Open R1 팀이 Claude 3.7 Sonnet을 능가하는 코딩 성능의 OlympicCoder 모델과 신규 데이터셋을 공개했다.
1 / 2
자세히 보기
Open R1 팀이 DeepSeek-R1의 코딩 추론 능력을 재현하기 위한 세 번째 업데이트를 발표했다. 이번 업데이트의 핵심은 고성능 코딩 모델인 OlympicCoder와 이를 학습시킨 CodeForces-CoTs 데이터셋, 그리고 새로운 IOI 벤치마크다.
주요 성과:
- CodeForces-CoTs 데이터셋: DeepSeek-R1을 통해 증류(distillation)한 약 10만 개의 고품질 C++ 및 Python CoT(Chain-of-Thought) 샘플을 포함한다.
- OlympicCoder 모델: CodeForces-CoTs 데이터셋으로 미세 조정된 7B 및 32B 모델이다. 특히 32B 모델은 IOI(국제 정보 올림피아드) 문제에서 Claude 3.7 Sonnet과 같은 폐쇄형 모델을 능가하는 성능을 보였다.
- IOI 벤치마크: 2024년 국제 정보 올림피아드(IOI)의 도전적인 문제들을 활용한 새로운 벤치마크를 도입했다.
또한, 기존 코딩 데이터셋들이 실제 대회에서 사용되는 전체 테스트 케이스를 포함하지 못해 발생하는 코드 검증성 위기(Code verifiability crisis) 문제를 지적하며, 더 정교한 검증 환경의 필요성을 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.