AI Briefing

주요 AI 벤치마크 오류 12% 발견 및 정제 버전 공개

[PAPER] GPQA, MMLU-Pro, and MMMU-Pro were audited for broken questions, and up to 12% of them had to be removed. New drop in clean versions released

·2026.07.29 04:58

핵심 내용

GPQA, MMLU-Pro 등 주요 AI 벤치마크에서 약 12%의 문항 오류가 발견되어 정제된 데이터셋이 공개됨.

자세히 보기

GPQA(Diamond/Extended), MMLU-Pro, MMMU-Pro 벤치마크를 전수 조사한 결과, 문항 구성 오류, 잘못된 정답 키, 복수 정답 가능성 등 약 12%의 문항이 결함이 있는 것으로 확인되었습니다.

이러한 오류를 수정하여 정제된 Clean 버전 데이터셋과 함께, 어떤 문항이 왜 결함이 있었는지 확인할 수 있는 상세 리스트(ledger)가 함께 공개되었습니다. 결함이 있는 문항을 제거한 후 테스트를 진행할 경우, 상위 모델들의 성능은 기존 92~93% 수준에서 약 98%까지 상승하는 것으로 나타났습니다.

공개된 리소스는 다음과 같습니다:

  • 정제된 벤치마크 데이터셋 (Hugging Face)
  • lm-eval-harness용 태스크
  • 오류 원인을 기록한 Flagged-candidate ledger
  • 상세 분석 내용이 담긴 논문 및 GitHub 저장소

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.