AI Briefing

주요 AI 벤치마크 오류 12% 발견 및 정제 버전 공개

[PAPER] GPQA, MMLU-Pro, and MMMU-Pro were audited for broken questions, and up to 12% of them had to be removed. New drop in clean versions released

·2026.07.29 04:58

GPQA, MMLU-Pro 등 주요 AI 벤치마크에서 약 12%의 문항 오류가 발견되어 정제된 데이터셋이 공개됨.

GPQA(Diamond/Extended), MMLU-Pro, MMMU-Pro 벤치마크를 전수 조사한 결과, 문항 구성 오류, 잘못된 정답 키, 복수 정답 가능성 등 약 12%의 문항이 결함이 있는 것으로 확인되었습니다.

이러한 오류를 수정하여 정제된 Clean 버전 데이터셋과 함께, 어떤 문항이 왜 결함이 있었는지 확인할 수 있는 상세 리스트(ledger)가 함께 공개되었습니다. 결함이 있는 문항을 제거한 후 테스트를 진행할 경우, 상위 모델들의 성능은 기존 92~93% 수준에서 약 98%까지 상승하는 것으로 나타났습니다.

공개된 리소스는 다음과 같습니다:

  • 정제된 벤치마크 데이터셋 (Hugging Face)
  • lm-eval-harness용 태스크
  • 오류 원인을 기록한 Flagged-candidate ledger
  • 상세 분석 내용이 담긴 논문 및 GitHub 저장소

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.