추천
SWE-Bench Pro V2 공개… 89개 태스크 제거 및 평가 프로토콜 강화
·2026.09.24 02:15
핵심 내용
Reflection과 공동 개발한 SWE-Bench Pro V2가 공개되었으며, 검증 과정에서 문제가 발견된 89개 태스크를 제거해 총 642개 태스크로 재편되고 평가 프로토콜이 강화되었습니다.
자세히 보기
SWE-Bench Pro V2는 AI 에이전트의 소프트웨어 엔지니어링 성능을 평가하는 벤치마크로, Reflection과 공동 개발되었습니다. 이번 버전에서는 검증 과정에서 문제가 발견된 89개 태스크를 제거하여 총 642개 태스크로 구성을 재편했습니다. 평가 프로토콜 강화 측면에서는 웹 도구나 외부 저장소 접근을 차단하여 모델이 정답을 검색하는 것을 방지하고, 에이전트가 모델 엔드포인트에 접근하는 것을 제한했습니다. 또한 모든 패치는 참조 구현과 비교하여 엄격하게 검증되며, 211개 태스크에는 개선된 의존성 지원이, 10개 태스크에는 검증기 오류 수정이 적용되었습니다. 주요 변경 사항으로는 지시문과 테스트가 모순된 69개 태스크에 대한 처리와, 패치 내 코드(conftest.py 등)가 여전히 검증기에 의해 실행되는 잔존 문제 등이 언급되었습니다. 최신 리더보드 기준으로는 Opus 5(Claude Code)가 98.00점으로 1위를 차지했으며, Fable 5.1(Claude Code)이 92.20점으로 2위, GPT-6(Codex)이 90.20점으로 3위를 기록했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.