GPT-5.5, 실코딩 태스크서 우세
GPT-5.5 vs GPT-5.4 vs Opus 4.7 on 56 real coding tasks from 2 open source repos
·2026.05.02 01:09
핵심 내용
56개 실코딩 태스크에서 GPT-5.5가 가장 안정적으로 리뷰를 통과했다.
자세히 보기
Zod와 graphql-go-tools에서 나온 56개 실코딩 태스크를 대상으로 GPT-5.5, GPT-5.4, Opus 4.7을 비교했다.
- 모델은 각자의 기본 에이전트 하네스에서 실행했다.
- Anthropic 계열은 Claude Code, OpenAI 계열은 Codex CLI를 사용했다.
- 평가는 단순 테스트 통과 여부가 아니라, 인간 패치와의 동등성, 코드리뷰 수용성, 패치 크기/발자국 위험, craft/discipline까지 포함했다.
결과적으로 GPT-5.5가 가장 자주 “배포 가능한” 기본값에 가까웠다. 테스트를 통과하고, 의도한 변경을 더 잘 반영하며, 리뷰를 견디는 패치를 더 자주 만들었다.
반면 Opus 4.7은 더 작은 패치를 자주 작성했다.
- Zod에서는 이 차이가 실제 트레이드오프로 나타났다.
- graphql-go-tools에서는 작은 패치가 오히려 미완성 구현으로 이어지는 경우가 더 보였다.
핵심 결론은 한 가지 점수로 모든 모델을 가를 수 없다는 것이다. 이 벤치마크는 리뷰 통과율이 병목인지, 아니면 패치 footprint가 병목인지에 따라 최적 모델이 달라진다는 점을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.