Claude Opus 4.7 비교
Tested Claude AI LLM Models' Effort Levels - Low To Max: How Claude Opus 4.7 differs
Claude Code에서 Opus 4.5·4.6·4.7과 Sonnet 4.6의 effort level별 비용과 토큰을 비교했다.
Claude Code CLI 2.1.117에서 Opus 4.5·4.6·4.7, Sonnet 4.6을 대상으로 low·medium·high·xhigh·max 5단계를 비교했다. 10개 고정 프롬프트를 각 조합에 돌렸고, 총 비용은 약 $18였다.
session-metrics가 Claude Code의 JSONL 트랜스크립트를 읽어 토큰과 가격을 재구성했다.- Anthropic의 사후분석에서 품질 저하 수정 버전으로 언급된 2.1.116+ 이후, 이 테스트는 2.1.117에서 진행됐다.
effort는 입력 토큰이 아니라 출력 토큰 다이얼이었다. 프롬프트당 입력 토큰은 약 6개로 거의 같았다.
모델별 패턴은 크게 세 갈래였다.
- Opus 4.6·4.5·Sonnet 4.6은
low에서도 **90~100%**의 턴에서 생각을 시작했다. - Opus 4.7은
low에서 생각 비율이 **18%**였지만max에서 **93%**까지 올라갔다. - Sonnet 4.6은 모든 rung에서 도구 호출을 유지했고, 같은 rung의 Opus보다 저렴해 토큰당 달러 효율이 2~5배 높았다. 가격표 자체도 Opus의 **60%**였다.
캐시 상태는 결과를 크게 흔들었다. 같은 모델과 같은 effort라도 1시간 캐시가 warm인지 cold인지에 따라 최대 1.88배 차이가 났고, 예를 들면 Opus 4.7 [1m] xhigh는 $1.12(warm) 대 $1.78(cold), Sonnet 4.6 medium은 $0.78 대 $1.46였다. warm 상태에서는 Sonnet 4.6 medium과 high의 효율 차이도 약 **5%**에 그쳤다.
순수 효율 기준으로는 Sonnet 4.6 high가 15,516 tok/$, Opus 4.7 high가 **3,015 tok/$**였다. 반대로 Opus 4.7 max는 low 대비 출력 토큰이 6.5배까지 늘어나 별도 모드처럼 움직였고, Opus 4.5는 같은 max에서도 증가폭이 2.1배에 그쳤다.
IFEval는 표본이 9개뿐이라 McNemar p-value가 0.25~0.5에 머물렀고, 이 범위에서는 유의미한 차이를 단정하기 어렵다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.