Claude Opus 4.7 비교
Tested Claude AI LLM Models' Effort Levels - Low To Max: How Claude Opus 4.7 differs
핵심 내용
Claude Code에서 Opus 4.5·4.6·4.7과 Sonnet 4.6의 effort level별 비용과 토큰을 비교했다.
자세히 보기
Claude Code CLI 2.1.117에서 Opus 4.5·4.6·4.7, Sonnet 4.6을 대상으로 low·medium·high·xhigh·max 5단계를 비교했다. 10개 고정 프롬프트를 각 조합에 돌렸고, 총 비용은 약 $18였다.
session-metrics가 Claude Code의 JSONL 트랜스크립트를 읽어 토큰과 가격을 재구성했다.- Anthropic의 사후분석에서 품질 저하 수정 버전으로 언급된 2.1.116+ 이후, 이 테스트는 2.1.117에서 진행됐다.
effort는 입력 토큰이 아니라 출력 토큰 다이얼이었다. 프롬프트당 입력 토큰은 약 6개로 거의 같았다.
모델별 패턴은 크게 세 갈래였다.
- Opus 4.6·4.5·Sonnet 4.6은
low에서도 **90~100%**의 턴에서 생각을 시작했다. - Opus 4.7은
low에서 생각 비율이 **18%**였지만max에서 **93%**까지 올라갔다. - Sonnet 4.6은 모든 rung에서 도구 호출을 유지했고, 같은 rung의 Opus보다 저렴해 토큰당 달러 효율이 2~5배 높았다. 가격표 자체도 Opus의 **60%**였다.
캐시 상태는 결과를 크게 흔들었다. 같은 모델과 같은 effort라도 1시간 캐시가 warm인지 cold인지에 따라 최대 1.88배 차이가 났고, 예를 들면 Opus 4.7 [1m] xhigh는 $1.12(warm) 대 $1.78(cold), Sonnet 4.6 medium은 $0.78 대 $1.46였다. warm 상태에서는 Sonnet 4.6 medium과 high의 효율 차이도 약 **5%**에 그쳤다.
순수 효율 기준으로는 Sonnet 4.6 high가 15,516 tok/$, Opus 4.7 high가 **3,015 tok/$**였다. 반대로 Opus 4.7 max는 low 대비 출력 토큰이 6.5배까지 늘어나 별도 모드처럼 움직였고, Opus 4.5는 같은 max에서도 증가폭이 2.1배에 그쳤다.
IFEval는 표본이 9개뿐이라 McNemar p-value가 0.25~0.5에 머물렀고, 이 범위에서는 유의미한 차이를 단정하기 어렵다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.