AI Briefing

GLM 5.2, ProgramBench 3위

GLM 5.2 gets 3rd place on official ProgramBench leaderboard

·2026.07.23 02:00

핵심 내용

GLM 5.2가 바이너리 실행파일로부터 소스코드를 재구성하는 ProgramBench 벤치마크에서 공식 3위를 기록했다.

1 / 2

자세히 보기

ProgramBench는 AI 에이전트가 바이너리 실행파일과 README만을 가지고 원본 소스코드를 재구성해야 하는 초장기(ultra long horizon) 벤치마크다.

GLM 5.2가 공식 리더보드에서 3위를 차지했다. 현재 리더보드에는 오픈소스·클로즈드소스 모델 다수가 아직 추가되지 않은 상태임에도 주목할 만한 성과로 평가된다.

특히 cmatrix 인스턴스에서 99.8% 테스트를 통과해 완전 해결에 근접했다. 유일하게 실패한 부분은 -L 잠금 모드 실행 시 화면에 "Computer locked." 문자열을 출력하지 못한 것뿐이었다.

전체 에이전트 궤적(trajectories)은 곧 programbench.com에 공개될 예정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.