MMLU 벤치마크 점수 불일치 원인 분석
What's going on with the Open LLM Leaderboard?
·2023.06.23 09:00
Open LLM Leaderboard와 모델 논문 간의 MMLU 벤치마크 점수 차이가 발생하는 기술적 원인을 분석한다.
최근 Falcon 모델 출시 이후, Open LLM Leaderboard에 표시된 MMLU 점수가 기존 LLaMA 논문에 발표된 수치와 크게 다르다는 점이 커뮤니티에서 논의되었습니다.
Hugging Face 팀은 이 불일치 원인을 파악하기 위해 세 가지 서로 다른 MMLU 구현 방식을 비교 분석했습니다:
- EleutherAI Harness: Open LLM Leaderboard에서 사용하는 구현 방식
- Stanford HELM: Stanford의 종합 평가 벤치마크에서 사용하는 방식
- Original Implementation: UC Berkeley 팀이 개발한 원본 구현 방식
분석 결과, 동일한 MMLU 데이터셋을 사용하더라도 어떤 평가 코드(implementation)를 사용하느냐에 따라 결과값이 달라짐을 확인했습니다. 이는 모델 자체의 성능 차이가 아니라, 벤치마크를 실행하는 라이브러리와 코드 구조의 차이에서 기인한 것입니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.