SWE-bench Verified가 더 이상 프런티어 코딩 역량을 측정하지 못하는 이유
·2026.04.27 18:35
OpenAI가 SWE-bench Verified 보고 중단과 새 평가 축 전환을 발표했다.
OpenAI는 SWE-bench Verified가 더 이상 프런티어 모델의 코딩 역량을 제대로 측정하지 못한다고 지적했다.
최근 최고 성능은 **74.9% → 80.9%**로 올라갔지만, 남은 실패가 모델 한계인지 벤치마크 결함인지 구분하기 어려워졌다고 봤다.
감사 대상 138개 문제를 검토한 결과, **59.4%**에서 테스트 설계나 문제 설명의 중대한 결함이 확인됐다.
주요 문제는 다음과 같다.
- 35.5%: 특정 구현을 강제하는 제한적인 테스트
- 18.8%: 명세에 없는 추가 기능까지 요구하는 과도한 테스트
- 일부 사례는 기능적으로 올바른 해법도 탈락시키는 구조였다
또한 공개 데이터와 코드베이스를 바탕으로 한 평가 특성상 학습 데이터 오염을 피하기 어려웠고, 일부 모델은 작업 ID나 짧은 설명만으로 골드 패치를 거의 그대로 재현했다.
이에 따라 OpenAI는 SWE-bench Verified 점수 보고를 중단했고, 오염 영향이 덜한 SWE-bench Pro와 비공개 벤치마크로 평가 축을 옮기고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.