코딩 평가에서 노이즈와 신호 구분하기
·2026.07.08 22:00
핵심 내용
OpenAI가 SWE-bench Pro 벤치마크의 약 30%가 설계 결함으로 인해 오류를 포함하고 있다고 발표했다.
자세히 보기
OpenAI는 최근 수행한 정밀 조사를 통해 코딩 벤치마크인 SWE-bench Pro의 상당수 태스크에 결함이 있음을 발견했다. 분석 결과, 전체 태스크의 약 **30%**가 제대로 된 성능 측정이 불가능한 'Broken' 상태인 것으로 추정된다.
발견된 주요 결함은 네 가지 범주로 분류된다:
- 과도하게 엄격한 테스트(Overly strict tests): 프롬프트에 명시되지 않은 세부 구현 사항을 강제함
- 불충분한 프롬프트(Underspecified prompts): 숨겨진 테스트가 요구하는 사항이 프롬프트에 누락됨
- 낮은 테스트 커버리지(Low-coverage tests): 요청된 기능의 일부만 검증하여 불완전한 수정안도 통과됨
- 오도하는 프롬프트(Misleading prompt): 모델을 잘못된 동작으로 유도하거나 테스트 요구사항과 모순됨
OpenAI는 모델의 실제 역량을 정확히 측정하기 위해 데이터 품질 보증(QA) 파이프라인을 구축했다. 이 파이프라인은 자동화된 필터링과 더불어 Investigator-agent를 활용한 심층 검토, 그리고 숙련된 소프트웨어 엔지니어들의 수동 검증을 결합하여 운영된다.
이번 결과는 고난도이면서도 공정한 벤치마크를 구축하는 것이 얼마나 어려운지를 보여준다. OpenAI는 모델 개발자들이 벤치마크 결과를 해석할 때 이러한 결함 가능성을 고려하여 주의 깊게 검토할 것을 권고했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.