Haiku가 Opus를 역전
tested 9 models with and without agent skills. Haiku 4.5 with a skill beat baseline Opus 4.7.
·2026.04.21 23:48
핵심 내용
880개 평가에서 Haiku 4.5+skill이 Opus 4.7 baseline을 앞섰다.
자세히 보기
880개 evals를 통해 11개 skills × 8개 models × 5 scenarios를, 각 skill을 넣은 상태와 없는 상태로 비교했다.
핵심 결과는 Haiku 4.5 baseline 61.2% 대비 **Haiku 4.5 + skill 84.3%**로 크게 상승했다는 점이다. 같은 조건의 **Opus 4.7 baseline은 80.5%**였다.
비용 효율도 두드러졌다.
- Haiku + skill: 실행당 $0.12
- Opus baseline: 실행당 $0.61
- skill을 Haiku에 넣는 추가 비용은 1.5센트 수준
- 같은 skill을 Opus에 넣으면 실행당 39센트가 추가됐다
모든 벤더에서 skill의 효과가 확인됐고, 약한 모델일수록 향상 폭이 더 컸다. Haiku는 +23.1p, Opus 4.7은 +14p를 기록했다.
실무적으로는 커밋 메시지, 코드 리뷰, 리팩터 제안처럼 반복적인 작업에서 Haiku + 좋은 skill 조합이 빠르고 충분히 정확하다는 해석을 제시했다. Codex 변종과 Cursor Composer-2도 skill을 넣었을 때 성능이 올라갔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.