새 버전이 꼭 더 좋은 건 아니다
Opus 4.7 released, but it’s still behind pre-regression Opus 4.6 on my real world tasks
·2026.04.17 02:34
핵심 내용
Opus 4.7은 범용 벤치마크와 달리 실제 워크플로에선 4.6보다 낮았다.
자세히 보기
실제 SaaS 워크플로용 reasoning·logic 테스트에서 claude-opus-4.6과 claude-opus-4.7을 비교했더니, 4.7이 더 새 버전인데도 정확도는 뒤졌다.
- claude-opus-4.6: 66% (47.0/71.0), 비용 $0.0257, 시간 44.50s
- claude-opus-4.7: 61% (43.0/71.0), 비용 $0.0170, 시간 36.56s
4.7은 더 저렴하고 더 빨랐지만, 이 사용자의 특정 에이전틱 플로우에서는 정확도와 안정성이 4.6보다 낮았다. 범용 평가에서 좋아 보이는 모델이 실제 업무 태스크에서도 더 낫다는 보장은 없다는 점을 강조한다.
또한 작성자는 최근 몇 달간 Opus 4.6의 성능 회귀도 체감했고, 릴리스 초기에 저장해 둔 평가 데이터 덕분에 그 회귀를 확인할 수 있었다고 말한다. 결론은 모델의 우열보다 태스크-모델 매칭이 더 중요하다는 것.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.