Opus 4.7 장문 회귀
Regression Comparisons From Opus 4.7 to Opus 4.6 for long context reasoning
·2026.04.17 00:46
핵심 내용
Opus 4.7는 코딩은 개선됐지만 장문 추론은 크게 회귀했다.
자세히 보기
시스템 카드 비교에서 Opus 4.7은 SWE-bench 계열에서는 개선됐지만, 나머지 5개 항목에서는 Opus 4.6이 우세했다.
- SWE-bench Verified: 80.8% → 87.6%
- SWE-bench Pro: 53.4% → 64.3%
반면 검색·장문 추론 계열은 하락했다.
- BrowseComp (10M token): 83.7% → 79.3%
- DeepSearchQA F1: 91.3% → 89.1%
- MRCR v2 8-needle @ 256k: 91.9% → 59.2%
- MRCR v2 8-needle @ 1M: 78.3% → 32.2%
- ARC-AGI-1: 93.0% → 92.0%
특히 MRCR v2 @ 1M에서 낙폭이 커, long-context에서 특정 정보를 정확히 찾아내는 능력은 4.7이 크게 약해진 신호로 읽힌다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.