코딩 평가에서 노이즈와 신호 구분하기
·2026.07.08 22:00
OpenAI가 SWE-bench Pro 벤치마크의 약 30%가 설계 결함으로 인해 오류를 포함하고 있다고 발표했다.
OpenAI는 최근 수행한 정밀 조사를 통해 코딩 벤치마크인 SWE-bench Pro의 상당수 태스크에 결함이 있음을 발견했다. 분석 결과, 전체 태스크의 약 **30%**가 제대로 된 성능 측정이 불가능한 'Broken' 상태인 것으로 추정된다.
발견된 주요 결함은 네 가지 범주로 분류된다:
- 과도하게 엄격한 테스트(Overly strict tests): 프롬프트에 명시되지 않은 세부 구현 사항을 강제함
- 불충분한 프롬프트(Underspecified prompts): 숨겨진 테스트가 요구하는 사항이 프롬프트에 누락됨
- 낮은 테스트 커버리지(Low-coverage tests): 요청된 기능의 일부만 검증하여 불완전한 수정안도 통과됨
- 오도하는 프롬프트(Misleading prompt): 모델을 잘못된 동작으로 유도하거나 테스트 요구사항과 모순됨
OpenAI는 모델의 실제 역량을 정확히 측정하기 위해 데이터 품질 보증(QA) 파이프라인을 구축했다. 이 파이프라인은 자동화된 필터링과 더불어 Investigator-agent를 활용한 심층 검토, 그리고 숙련된 소프트웨어 엔지니어들의 수동 검증을 결합하여 운영된다.
이번 결과는 고난도이면서도 공정한 벤치마크를 구축하는 것이 얼마나 어려운지를 보여준다. OpenAI는 모델 개발자들이 벤치마크 결과를 해석할 때 이러한 결함 가능성을 고려하여 주의 깊게 검토할 것을 권고했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.