AI Briefing

Claude Opus 4.7 비교

Tested Claude AI LLM Models' Effort Levels - Low To Max: How Claude Opus 4.7 differs

·2026.04.24 09:41

Claude Code에서 Opus 4.5·4.6·4.7과 Sonnet 4.6의 effort level별 비용과 토큰을 비교했다.

Claude Code CLI 2.1.117에서 Opus 4.5·4.6·4.7, Sonnet 4.6을 대상으로 low·medium·high·xhigh·max 5단계를 비교했다. 10개 고정 프롬프트를 각 조합에 돌렸고, 총 비용은 약 $18였다.

  • session-metrics가 Claude Code의 JSONL 트랜스크립트를 읽어 토큰과 가격을 재구성했다.
  • Anthropic의 사후분석에서 품질 저하 수정 버전으로 언급된 2.1.116+ 이후, 이 테스트는 2.1.117에서 진행됐다.
  • effort는 입력 토큰이 아니라 출력 토큰 다이얼이었다. 프롬프트당 입력 토큰은 약 6개로 거의 같았다.

모델별 패턴은 크게 세 갈래였다.

  • Opus 4.6·4.5·Sonnet 4.6은 low에서도 **90~100%**의 턴에서 생각을 시작했다.
  • Opus 4.7은 low에서 생각 비율이 **18%**였지만 max에서 **93%**까지 올라갔다.
  • Sonnet 4.6은 모든 rung에서 도구 호출을 유지했고, 같은 rung의 Opus보다 저렴해 토큰당 달러 효율이 2~5배 높았다. 가격표 자체도 Opus의 **60%**였다.

캐시 상태는 결과를 크게 흔들었다. 같은 모델과 같은 effort라도 1시간 캐시가 warm인지 cold인지에 따라 최대 1.88배 차이가 났고, 예를 들면 Opus 4.7 [1m] xhigh$1.12(warm) 대 $1.78(cold), Sonnet 4.6 medium$0.78$1.46였다. warm 상태에서는 Sonnet 4.6 mediumhigh의 효율 차이도 약 **5%**에 그쳤다.

순수 효율 기준으로는 Sonnet 4.6 high15,516 tok/$, Opus 4.7 high가 **3,015 tok/$**였다. 반대로 Opus 4.7 maxlow 대비 출력 토큰이 6.5배까지 늘어나 별도 모드처럼 움직였고, Opus 4.5는 같은 max에서도 증가폭이 2.1배에 그쳤다.

IFEval는 표본이 9개뿐이라 McNemar p-value가 0.25~0.5에 머물렀고, 이 범위에서는 유의미한 차이를 단정하기 어렵다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.