HF, LLM 리더보드 수학 평가 개선
Fixing Open LLM Leaderboard with Math-Verify
·2025.02.14 09:00
핵심 내용
Hugging Face가 Math-Verify 도입으로 Open LLM Leaderboard의 수학 평가 오류를 해결하고 순위를 재산정했다.
자세히 보기
Hugging Face가 Open LLM Leaderboard의 수학 성능 평가(MATH-Hard) 과정에서 발생하던 오류를 해결하기 위해 새로운 검증 도구인 Math-Verify를 도입했다.
기존 평가 방식은 모델이 특정 답변 형식을 엄격히 준수해야 했으며, SymPy를 이용한 파싱 과정에서 수식, 행렬, 구간 표현 등을 제대로 인식하지 못해 정답을 오답으로 처리하는 문제가 빈번했다.
Math-Verify는 다음과 같은 핵심 문제를 해결한다:
- 답변 추출 능력 강화: 모델이 정해진 형식을 따르지 않더라도 정답을 정확히 추출.
- 파싱 및 비교 지원 확대: 행렬, 구간, 집합 비교 및 수치적 반올림 지원.
이번 업데이트를 통해 기존에 제출된 3,751개 모델에 대한 재평가가 완료되었으며, 평가의 공정성이 높아짐에 따라 리더보드의 모델 순위가 대폭 재편되었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.