수학적 추론의 효과적인 프로세스 감독(Process Supervision)을 향하여
·2025.01.14 01:00
Qwen이 수학적 추론의 단계별 오류를 식별하는 새로운 PRM과 벤치마크 ProcessBench를 공개했다.
LLM은 수학적 추론 시 계산 실수나 논리적 오류를 범할 수 있으며, 최종 답안이 정답이더라도 중간 과정이 틀린 경우가 많아 신뢰성 문제가 발생한다. 이를 해결하기 위해 중간 단계의 오류를 식별하고 완화하는 **Process Reward Models (PRMs)**가 핵심적인 역할을 한다.
Qwen은 수학적 추론의 단계별 오류를 측정하기 위한 새로운 벤치마크인 ProcessBench를 공개했다. 이 벤치마크는 경시 대회 및 올림피아드 수준의 수학 문제 3,400개를 포함하며, 전문가가 직접 오류 위치를 주석 처리한 단계별 풀이로 구성되어 있다.
또한, Qwen2.5-Math-PRM-7B 및 72B 모델을 함께 출시했다.
- Best-of-N (BoN) 평가: 7B 모델은 GSM8K, MATH 등 7개 태스크에서 기존 PRM보다 우수한 성능을 보였으며, 모든 태스크에서 majority voting(maj@8) 성능을 상회했다.
- ProcessBench 평가: 7B 모델은 모든 오픈 소스 모델을 능가하며, 유료 모델인 GPT-4o-0806보다 높은 성능을 기록했다.
한편, 결과 기반 보상 모델인 Qwen2.5-Math-RM-72B 역시 단계별 오류를 식별하는 데 상당한 능력을 보여, 규칙 기반 메커니즘을 넘어선 보상 모델의 잠재력을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.