HF, LLM 리더보드 수학 평가 개선
Fixing Open LLM Leaderboard with Math-Verify
·2025.02.14 09:00
Hugging Face가 Math-Verify 도입으로 Open LLM Leaderboard의 수학 평가 오류를 해결하고 순위를 재산정했다.
Hugging Face가 Open LLM Leaderboard의 수학 성능 평가(MATH-Hard) 과정에서 발생하던 오류를 해결하기 위해 새로운 검증 도구인 Math-Verify를 도입했다.
기존 평가 방식은 모델이 특정 답변 형식을 엄격히 준수해야 했으며, SymPy를 이용한 파싱 과정에서 수식, 행렬, 구간 표현 등을 제대로 인식하지 못해 정답을 오답으로 처리하는 문제가 빈번했다.
Math-Verify는 다음과 같은 핵심 문제를 해결한다:
- 답변 추출 능력 강화: 모델이 정해진 형식을 따르지 않더라도 정답을 정확히 추출.
- 파싱 및 비교 지원 확대: 행렬, 구간, 집합 비교 및 수치적 반올림 지원.
이번 업데이트를 통해 기존에 제출된 3,751개 모델에 대한 재평가가 완료되었으며, 평가의 공정성이 높아짐에 따라 리더보드의 모델 순위가 대폭 재편되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.