4.7이 69승
Claude Opus 4.7 won 69 of 100 blind evals against Opus 4.6, judged by GPT-5.4, Gemini 3.1 Pro, and DeepSeek V3.2
핵심 내용
100문항 블라인드 평가에서 Opus 4.7이 4.6을 69대30으로 앞섰다.
자세히 보기
OpenRouter로 Claude Opus 4.7과 Opus 4.6을 같은 조건에서 돌린 뒤, 100개 블라인드 질문으로 비교했다.
평가는 code, reasoning, analysis, communication, meta-alignment의 5개 범주로 나뉘었고, 각 답변은 A/B 랜덤 순서로 제시됐다. 판정은 GPT-5.4, Gemini 3.1 Pro, DeepSeek V3.2 세 모델이 맡았고, 다수결로 승자를 정했다.
집계 결과는 Opus 4.7 69승, 4.6 30승, 1무였다. 판정자별로는 GPT-5.4가 69.7%, **Gemini 3.1 Pro가 77.6%**로 4.7을 선호했지만, DeepSeek V3.2는 54대38로 4.6을 더 자주 선택했다.
범주별 집계에서도 4.7이 전반적으로 우세했다.
- Code: 13대6, 1무
- Reasoning: 12대8
- Analysis: 16대4
- Communication: 14대6
- Meta-alignment: 13대7
핵심 결론은 단일 심사자 기준 리더보드가 얼마나 흔들릴 수 있는지다. 같은 질문과 같은 블라인드 프로토콜이어도, 어떤 모델을 심사자로 쓰느냐에 따라 결론이 바뀌었다.
조건도 함께 공개됐다. 두 모델은 OpenRouter를 통해 접근했고, 생성 설정은 temperature 0.7, max_tokens 4096으로 맞췄다. 심사자 설정은 temperature 0.2였고, Gemini 판단 2건은 구조화 출력 실패로 제외됐다. 저자는 100문항은 방향성 파악에는 충분하지만 세부 범주 결론을 단정하기엔 부족하다고 적었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.