전문가 재채점 결과, 물리 벤치마크 결함으로 프론티어 모델 성능 과소평가 확인
·2026.09.14 09:00
핵심 내용
전문가 재채점을 통해 기존 물리 벤치마크의 채점 오류와 결함으로 인해 프론티어 모델의 실제 능력이 과소평가되었음을 확인했다.
자세히 보기
기존 물리 벤치마크에서 프론티어 모델이 낮은 점수를 기록한 이유는 모델의 능력 부족이 아니라 평가 시스템 자체의 결함인 것으로 드러났다. Ali Ansari 등 50여 명의 연구진은 6개 주요 물리 벤치마크에 대해 전문가 감사를 진행하여 채점 오류, 잘못된 참조 해답, 모호한 문제 등을 식별하고 수정했다.
오류를 교정하고 결함이 있는 문제를 제외한 후 재평가한 결과, 모델의 성능이 대폭 상승했다. 특히 GPT-5.6-Sol의 경우 HLE-Physics에서 mean@4 점수가 47.3%에서 78.7%로, CMT-Benchmark에서는 61.0%에서 87.2%로 급등했다. CMT-Benchmark의 유지된 54개 문제에서는 pass@4가 94.4%에 달했다.
이러한 결과는 기존 벤치마크가 잘 정의된 물리 문제에 대한 프론티어 모델의 능력을 크게 과소평가하고 있음을 시사한다. 연구진은 폐쇄형 과제에서 모델 성능이 근접 포화 상태에 이르렀음을 지적하며, 더 엄격하고 전문가가 검증된 평가 기준의 필요성을 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.