AI Briefing

Haiku가 Opus를 역전

tested 9 models with and without agent skills. Haiku 4.5 with a skill beat baseline Opus 4.7.

·2026.04.21 23:48

핵심 내용

880개 평가에서 Haiku 4.5+skill이 Opus 4.7 baseline을 앞섰다.

자세히 보기

880개 evals를 통해 11개 skills × 8개 models × 5 scenarios를, 각 skill을 넣은 상태와 없는 상태로 비교했다.

핵심 결과는 Haiku 4.5 baseline 61.2% 대비 **Haiku 4.5 + skill 84.3%**로 크게 상승했다는 점이다. 같은 조건의 **Opus 4.7 baseline은 80.5%**였다.

비용 효율도 두드러졌다.

  • Haiku + skill: 실행당 $0.12
  • Opus baseline: 실행당 $0.61
  • skill을 Haiku에 넣는 추가 비용은 1.5센트 수준
  • 같은 skill을 Opus에 넣으면 실행당 39센트가 추가됐다

모든 벤더에서 skill의 효과가 확인됐고, 약한 모델일수록 향상 폭이 더 컸다. Haiku는 +23.1p, Opus 4.7은 +14p를 기록했다.

실무적으로는 커밋 메시지, 코드 리뷰, 리팩터 제안처럼 반복적인 작업에서 Haiku + 좋은 skill 조합이 빠르고 충분히 정확하다는 해석을 제시했다. Codex 변종과 Cursor Composer-2도 skill을 넣었을 때 성능이 올라갔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.