AI Briefing

OpenAI SWE-bench 보고 중단·권고, 해결책은 '평가자 주도 검증'

Why decontamination reports can’t fix benchmark contamination, and what an evaluator has to do instead

·2026.09.20 23:09

핵심 내용

OpenAI가 SWE-bench Verified 보고 중단을 권고한 가운데, 기존 데이터 정화 방식의 한계를 지적하고 평가자 주도 검증 방식을 제안했다.

자세히 보기

OpenAI는 2월, 모든 프론티어 모델이 일부 SWE-bench Verified 작업의 인간 작성 수정안이나 문제 진술을 그대로 재현할 수 있다는 점을 들어 해당 벤치마크 보고 중단을 권고했다. 이는 모델의 실제 능력 향상 여부와 무관하게 점수가 정체되는 현상을 반영한 조치다.

기존의 '데이터 정화(decontamination)' 보고서는 세 가지 근본적인 한계로 인해 벤치마크 오염 문제를 해결할 수 없다:

  • 자체 검증의 한계: 외부인은 학습 데이터셋에 접근할 수 없어 검색 과정을 재현할 수 없다.
  • 공개 불가: 데이터셋에는 저작권이 있는 저작물 목록이 포함되어 있어 공개 시 법적 리스크가 발생한다.
  • 매칭의 불완전성: 패러프레이징, 포럼 글, GitHub 코드, 합성 데이터 등 n-gram이 겹치지 않는 형태로도 모델이 정답을 학습할 수 있다.

이에 따라 저자는 평가자가 테스트를 통제하는 방식을 제안한다. 제출자에게 라벨을 제공하지 않고, 네트워크 없이 평가를 실행하며, 평가자가 지정된 커밋에서 코드를 직접 빌드해 점수를 재현해야 한다. 또한 제출 마감 이후에 테스트 데이터를 생성하는 방식을 통해 신뢰성을 확보한다.

저자는 이 원칙을 적용한 소규모 프레임워크를 공개했으나, 숨겨진 테스트셋의 반복 제출을 통한 정보 유출 방지 등 일부 한계는 여전히 남아 있다고 인정했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.