AI Briefing

4.7이 69승

Claude Opus 4.7 won 69 of 100 blind evals against Opus 4.6, judged by GPT-5.4, Gemini 3.1 Pro, and DeepSeek V3.2

·2026.04.18 06:54

핵심 내용

100문항 블라인드 평가에서 Opus 4.7이 4.6을 69대30으로 앞섰다.

자세히 보기

OpenRouter로 Claude Opus 4.7과 Opus 4.6을 같은 조건에서 돌린 뒤, 100개 블라인드 질문으로 비교했다.

평가는 code, reasoning, analysis, communication, meta-alignment의 5개 범주로 나뉘었고, 각 답변은 A/B 랜덤 순서로 제시됐다. 판정은 GPT-5.4, Gemini 3.1 Pro, DeepSeek V3.2 세 모델이 맡았고, 다수결로 승자를 정했다.

집계 결과는 Opus 4.7 69승, 4.6 30승, 1무였다. 판정자별로는 GPT-5.4가 69.7%, **Gemini 3.1 Pro가 77.6%**로 4.7을 선호했지만, DeepSeek V3.2는 54대38로 4.6을 더 자주 선택했다.

범주별 집계에서도 4.7이 전반적으로 우세했다.

  • Code: 13대6, 1무
  • Reasoning: 12대8
  • Analysis: 16대4
  • Communication: 14대6
  • Meta-alignment: 13대7

핵심 결론은 단일 심사자 기준 리더보드가 얼마나 흔들릴 수 있는지다. 같은 질문과 같은 블라인드 프로토콜이어도, 어떤 모델을 심사자로 쓰느냐에 따라 결론이 바뀌었다.

조건도 함께 공개됐다. 두 모델은 OpenRouter를 통해 접근했고, 생성 설정은 temperature 0.7, max_tokens 4096으로 맞췄다. 심사자 설정은 temperature 0.2였고, Gemini 판단 2건은 구조화 출력 실패로 제외됐다. 저자는 100문항은 방향성 파악에는 충분하지만 세부 범주 결론을 단정하기엔 부족하다고 적었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.