Opus 5.5 벤치마크: 지능은 1위, 보안 암기와 비용은 약점
Opus 5.5 benchmarks from two outside sources side-by-side
·2026.09.26 23:15
핵심 내용
Opus 5.5는 지능 지수 58점으로 선두지만, 높은 토큰 사용량으로 태스크당 비용이 GPT-6 Astra보다 비싸다.
자세히 보기
Artificial Analysis와 Endor Labs의 독립 평가 결과, Claude Opus 5.5가 지능 지표에서는 우위를 점했으나 비용 효율성과 보안 신뢰성에서는 트레이드오프가 존재하는 것으로 나타났다.
지능 및 비용 효율성
10개 테스트를 집계한 Artificial Analysis Intelligence Index에서 Opus 5.5는 58점을 기록하며 53점인 GPT-6 Astra와 Fable 5.1을 앞섰다. 모든 모델은 최대 노력(maximum effort) 설정으로 평가됐다.
- Terminal-Bench 4.0: Opus 5.5(60%)와 GPT-6 Astra(59%)의 성능은 거의 유사했다.
- SciCode: Opus 5.5는 Astra를 11점 차이로 크게 앞서며 우위를 보였다.
- 태스크당 비용: 토큰 단가는 낮지만 Opus 5.5는 태스크 완료에 더 많은 토큰을 소모한다. 최대 노력 기준 태스크당 비용은 Opus 5.5가 $5.98로, GPT-6 Astra($3.26)와 Fable 5.1($7.63) 대비 중간 수준이다.
보안 및 암기 문제
Endor Labs는 보안 수정 이력이 있는 실제 오픈소스 프로젝트와 숨겨진 테스트를 통해 모델에 알리지 않고 안전성을 검증했다.
- 성공률: Fable 5.1이 **37.4%**로 가장 높은 안전한 완료율을 기록했으며, Opus 5.5(33.5%)와 Opus 5(32.4%)가 뒤를 이었다.
- 암기 문제: Endor Labs는 Opus 5.5가 학습 데이터에 포함된 알려진 보안 수정 사항을 51회 회상하는 것을 관찰했다. 이는 테스트된 다른 모델보다 많은 수치로, 해당 사례는 안전한 완료 카운트에서 제외됐다. 만약 이를 포함할 경우 Opus 5.5는 보안 지표에서 11점 이상 차이로 1위를 차지했을 것이다.
- 성능 지표: Opus 5.5의 전체 Endor Labs 실행 비용은 $116으로, Fable 5.1($672)과 Opus 5($1,116)보다 훨씬 저렴했다. 태스크당 중위 시간은 2.2분이었으며 타임아웃은 발생하지 않았다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.