GPT-5.5, 실코딩 태스크서 우세
GPT-5.5 vs GPT-5.4 vs Opus 4.7 on 56 real coding tasks from 2 open source repos
·2026.05.02 01:09
56개 실코딩 태스크에서 GPT-5.5가 가장 안정적으로 리뷰를 통과했다.
Zod와 graphql-go-tools에서 나온 56개 실코딩 태스크를 대상으로 GPT-5.5, GPT-5.4, Opus 4.7을 비교했다.
- 모델은 각자의 기본 에이전트 하네스에서 실행했다.
- Anthropic 계열은 Claude Code, OpenAI 계열은 Codex CLI를 사용했다.
- 평가는 단순 테스트 통과 여부가 아니라, 인간 패치와의 동등성, 코드리뷰 수용성, 패치 크기/발자국 위험, craft/discipline까지 포함했다.
결과적으로 GPT-5.5가 가장 자주 “배포 가능한” 기본값에 가까웠다. 테스트를 통과하고, 의도한 변경을 더 잘 반영하며, 리뷰를 견디는 패치를 더 자주 만들었다.
반면 Opus 4.7은 더 작은 패치를 자주 작성했다.
- Zod에서는 이 차이가 실제 트레이드오프로 나타났다.
- graphql-go-tools에서는 작은 패치가 오히려 미완성 구현으로 이어지는 경우가 더 보였다.
핵심 결론은 한 가지 점수로 모든 모델을 가를 수 없다는 것이다. 이 벤치마크는 리뷰 통과율이 병목인지, 아니면 패치 footprint가 병목인지에 따라 최적 모델이 달라진다는 점을 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.