GPT 5.5, ProgramBench 첫 해결
GPT 5.5 outperforming Opus 4.7 on ProgramBench
·2026.05.13 02:40
ProgramBench 첫 풀이에서 GPT-5.5가 Opus 4.7을 앞섰다.
ProgramBench는 컴파일된 바이너리와 문서만 주고, 소스를 처음부터 재구현하게 하는 벤치마크다. 새 반영에서 **GPT 5.5 (high)**와 **GPT 5.5 (xhigh)**가 cmatrix를 완전 해결하며 첫 성공 사례를 만들었다.
**GPT 5.5 (xhigh)**는 **Claude Opus 4.7 (xhigh)**보다 모든 핵심 지표에서 앞섰다.
- 완전 해결: 0.5% vs 0%
- 95% 이상 해결: 13.5% vs 4.5%
개별 실행에서도 효율 차이가 컸다.
- GPT 5.5 (high): C 구현, 34 API 호출, $3.17
- GPT 5.5 (xhigh): Python 구현, 40 API 호출, $4.84
- Claude Opus 4.7 (xhigh): 178 API 호출, $10.74, 실패 19건
저자들은 GPT-5.5가 명령을 &&로 묶는 식으로 행동을 더 크게 통합해, 더 적은 에이전트 단계와 높은 토큰 효율을 보였다고 설명했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.