DROP 벤치마크 점수 오류 원인 규명
Open LLM Leaderboard: DROP deep dive
·2023.12.01 09:00
Open LLM Leaderboard의 DROP 벤치마크에서 모델 점수가 비정상적으로 낮게 측정된 원인이 평가 지표의 정규화 오류임을 밝혀냈다.
Open LLM Leaderboard에 추가된 DROP(Discrete Reasoning Over Paragraphs) 벤치마크에서 대부분의 모델이 100점 만점에 10점 미만의 낮은 F1 점수를 기록하는 이상 현상이 발견되었다.
조사 결과, 이는 모델의 성능 문제라기보다 평가 지표의 정규화(Normalization) 과정에서 발생한 기술적 오류 때문인 것으로 밝혀졌다.
주요 원인은 다음과 같다:
- 숫자 정규화 실패: 모델이 정답 숫자를 생성한 후, 숫자 바로 뒤에 공백(space)이 아닌 줄바꿈(\n) 등의 특수 문자가 올 경우, 정규화 단계에서 이를 숫자로 인식하지 못하는 문제가 있었다.
- 데이터 불일치: 정규화되지 않은 문자열이 단어 주머니(BOW) 형태로 비교되면서, 모델이 정답을 맞혔음에도 불구하고 정답 데이터와 일치하지 않는 것으로 처리되었다.
이번 분석은 Zeno와의 협업을 통해 진행되었으며, 벤치마크 점수가 모델의 실제 성능을 왜곡할 수 있음을 시사한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.