SWE-bench Verified는 더 이상 최첨단 코딩 역량을 측정하지 못한다
·2026.04.07 18:06
핵심 내용
OpenAI가 SWE-bench Verified의 오염과 시험 결함을 지적하며 중단을 권고했다.
자세히 보기
OpenAI가 SWE-bench Verified가 더 이상 프런티어 코드 모델의 실제 역량을 제대로 반영하지 못한다고 밝혔다. 성능 향상이 둔화된 가운데, 남은 실패가 모델 한계인지 데이터셋 문제인지 다시 점검한 결과라고 설명했다.
주요 문제는 두 가지다.
- 테스트 결함: 감사한 138개 문제 중 **59.4%**에서 테스트가 잘못되어, 기능적으로 맞는 해답도 실패할 수 있었다.
- 학습 오염: 프런티어 모델들이 훈련 과정에서 문제나 정답 패치를 이미 접했을 가능성이 높았고, 실제로 일부 모델은 gold patch나 문제 서술의 세부를 그대로 재현했다.
OpenAI는 예시로 두 가지 실패 유형을 제시했다.
- narrow test cases: 구현 세부까지 강제해, 정답이 여러 방식일 수 있는 문제를 과도하게 제한함
- wide test cases: 문제 설명에 없는 추가 기능까지 검사해, 설명대로 고친 모델을 탈락시킴
초기 SWE-bench의 한계를 보완하려고 OpenAI는 2024년에 전문가 검토를 거쳐 SWE-bench Verified 500문항을 만들었지만, 이번 분석에서 그 버전도 현재 수준의 프런티어 모델 평가에는 부적합하다고 결론냈다.
OpenAI는 이제 SWE-bench Verified 점수 보고를 중단했고, 대신 오염되지 않은 새 평가를 만들겠다고 밝혔다. 당분간은 SWE-bench Pro 결과를 보고할 것을 권고했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.