GPT 5.5, ProgramBench 첫 해결
GPT 5.5 outperforming Opus 4.7 on ProgramBench
·2026.05.13 02:40
핵심 내용
ProgramBench 첫 풀이에서 GPT-5.5가 Opus 4.7을 앞섰다.
자세히 보기
ProgramBench는 컴파일된 바이너리와 문서만 주고, 소스를 처음부터 재구현하게 하는 벤치마크다. 새 반영에서 **GPT 5.5 (high)**와 **GPT 5.5 (xhigh)**가 cmatrix를 완전 해결하며 첫 성공 사례를 만들었다.
**GPT 5.5 (xhigh)**는 **Claude Opus 4.7 (xhigh)**보다 모든 핵심 지표에서 앞섰다.
- 완전 해결: 0.5% vs 0%
- 95% 이상 해결: 13.5% vs 4.5%
개별 실행에서도 효율 차이가 컸다.
- GPT 5.5 (high): C 구현, 34 API 호출, $3.17
- GPT 5.5 (xhigh): Python 구현, 40 API 호출, $4.84
- Claude Opus 4.7 (xhigh): 178 API 호출, $10.74, 실패 19건
저자들은 GPT-5.5가 명령을 &&로 묶는 식으로 행동을 더 크게 통합해, 더 적은 에이전트 단계와 높은 토큰 효율을 보였다고 설명했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.