AI Briefing

SWE-bench 오염 확인

Confirmed: SWE Bench is now a benchmaxxed benchmark

·2026.04.27 03:26

OpenAI가 SWE-bench Verified 오염과 결함을 지적하며 중단을 권고했다.

OpenAI가 SWE-bench Verified를 더 이상 프런티어 모델 성능 지표로 쓰기 어렵다고 밝혔다.

최근 6개월간 점수는 **74.9%에서 80.9%**로 올랐지만, 남은 실패의 상당수가 모델 한계가 아니라 데이터셋과 테스트 설계 문제라고 봤다.

핵심 문제는 두 가지다.

  • 테스트 결함: OpenAI가 검토한 138개 문제 중 **59.4%**에서 정답을 잘못 탈락시키는 테스트나 설명 불일치가 발견됐다.
    • **35.5%**는 구현 세부를 과도하게 강제하는 narrow test case였다.
    • **18.8%**는 문제 설명에 없는 기능까지 요구하는 wide test case였다.
    • **5.1%**는 기타 문제였다.
  • 훈련 오염: 프런티어 모델들이 골드 패치나 문제 문구의 세부를 재현해, 학습 과정에서 이미 노출됐을 가능성이 높다고 판단했다.

오염 여부를 확인하기 위해 GPT-5를 이용해 GPT-5.2-Chat, Claude Opus 4.5, Gemini 3 Flash Preview를 상대로 15턴 탐색을 진행했고, 일부 사례에서는 정확한 골드 패치와 구현 세부까지 복원됐다.

OpenAI는 이제 SWE-bench Verified 점수 보고를 중단하겠다고 했고, 대안으로 SWE-bench Pro를 제안했다. 동시에 새롭고 오염되지 않은 코드 평가를 구축 중이라고 밝혔다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.