AI Briefing

Opus 4.7 장문 회귀

Regression Comparisons From Opus 4.7 to Opus 4.6 for long context reasoning

·2026.04.17 00:46

핵심 내용

Opus 4.7는 코딩은 개선됐지만 장문 추론은 크게 회귀했다.

자세히 보기

시스템 카드 비교에서 Opus 4.7은 SWE-bench 계열에서는 개선됐지만, 나머지 5개 항목에서는 Opus 4.6이 우세했다.

  • SWE-bench Verified: 80.8% → 87.6%
  • SWE-bench Pro: 53.4% → 64.3%

반면 검색·장문 추론 계열은 하락했다.

  • BrowseComp (10M token): 83.7% → 79.3%
  • DeepSearchQA F1: 91.3% → 89.1%
  • MRCR v2 8-needle @ 256k: 91.9% → 59.2%
  • MRCR v2 8-needle @ 1M: 78.3% → 32.2%
  • ARC-AGI-1: 93.0% → 92.0%

특히 MRCR v2 @ 1M에서 낙폭이 커, long-context에서 특정 정보를 정확히 찾아내는 능력은 4.7이 크게 약해진 신호로 읽힌다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.