GLM 5.2, ProgramBench 3위
GLM 5.2 gets 3rd place on official ProgramBench leaderboard
·2026.07.23 02:00
GLM 5.2가 바이너리 실행파일로부터 소스코드를 재구성하는 ProgramBench 벤치마크에서 공식 3위를 기록했다.
ProgramBench는 AI 에이전트가 바이너리 실행파일과 README만을 가지고 원본 소스코드를 재구성해야 하는 초장기(ultra long horizon) 벤치마크다.
GLM 5.2가 공식 리더보드에서 3위를 차지했다. 현재 리더보드에는 오픈소스·클로즈드소스 모델 다수가 아직 추가되지 않은 상태임에도 주목할 만한 성과로 평가된다.
특히 cmatrix 인스턴스에서 99.8% 테스트를 통과해 완전 해결에 근접했다. 유일하게 실패한 부분은 -L 잠금 모드 실행 시 화면에 "Computer locked." 문자열을 출력하지 못한 것뿐이었다.
전체 에이전트 궤적(trajectories)은 곧 programbench.com에 공개될 예정이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.