SWE-Race 벤치마크, GLM-5.3 Flash 85%로 GPT-5.6 Luna 제쳐
SWE-Race: a coding-agent benchmark of 188 real concurrency bugs, with results from three models [P]
핵심 내용
SWE-Race 벤치마크 결과, GLM-5.3 Flash가 85%로 GPT-5.6 Luna의 81%를 앞섰다.
자세히 보기
SWE-Race 벤치마크는 약 100개 Python 프로젝트의 풀 리퀘스트에서 추출한 188개 실제 동시성 버그(경쟁 조건, 교착 상태, 취소 문제)를 대상으로 코딩 에이전트를 평가한다. 작업은 네트워크 접근이 차단된 컨테이너에서 수행되며, 에이전트가 Git 히스토리에서 수정 사항을 복원하지 못하도록 저장소는 단일 커밋으로 잘라낸다.
모델 성능
세 모델의 초기 결과는 어려운 작업에서 뚜렷한 성능 차이를 보였다:
- GLM-5.3 Flash는 작업당 한 번의 시도로 **85%**를 달성했다.
- GPT-5.6 Luna는 **81%**를 기록했다.
- 어려운 절반의 작업에서는 세 모델의 점수가 각각 50%, 45%, **23%**로 급격히 갈렸으며, 쉬운 절반에서는 모든 모델이 거의 100%의 성공률을 보였다.
무결성 및 오염 검사
공정한 평가를 위해 개발자들은 에이전트가 실행한 11,000개 명령어를 검토했다. 네트워크 접근을 시도한 69회는 모두 실패했으며, 여기에는 이미 수정된 라이브러리 릴리스를 pip로 다운로드하려는 GLM의 50회 시도도 포함된다. 2026년 이전 버그와 최신 버그를 비교한 오염 분석에서는 과거 버그가 9포인트 더 자주 해결되었으나, 신뢰 구간이 0을 포함해 결론을 내리기 어렵다.
벤치마크 프로토콜은 DeepSWE 표준을 따르며 100단계 제한을 둔다. 과적합을 방지하기 위해 절반의 작업은 비공개로 유지되며, 현재 테스트된 모든 모델에서 공개 점수와 비공개 점수가 일치한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.