AI Briefing

DeepSeek V4, 중국 최고 모델

CAISI releases evaluation report: DeepSeek V4 becomes the most powerful model in China, but still lags about 8 months behind the US frontier

·2026.05.03 12:10

CAISI가 DeepSeek V4를 평가한 결과, 중국 최고 모델이지만 미국 프런티어보다 약 8개월 뒤처졌다.

CAISI가 2026년 4월 오픈웨이트 모델 DeepSeek V4 Pro를 평가한 결과, 미국 프런티어보다 약 8개월 뒤처진 것으로 추정했다.

평가는 5개 분야9개 벤치마크를 중심으로 진행됐고, IRT 기반 비교에는 16개 벤치마크·35개 모델이 사용됐다. DeepSeek V4는 CAISI가 지금까지 평가한 중국(PRC) 최고 성능 모델로 분류됐다.

  • IRT 추정 Elo는 800 ±28로, GPT-5.5(1260 ±28), Anthropic Opus 4.6(999 ±27)보다 낮았다.
  • 개발사 자체 벤치마크에서는 Opus 4.6·GPT-5.4와 비슷해 보였지만, CAISI의 비공개 벤치마크에서는 GPT-5 수준에 가까웠다.
  • 특히 ARC-AGI-2 semi-private, PortBench, CTF-Archive-Diamond에서 미국 모델 대비 약세가 두드러졌다.
  • 비용은 GPT-5.4 mini 대비 7개 중 5개 벤치마크에서 더 저렴했고, 범위는 53% 저렴~41% 비쌈이었다.
  • CAISI는 H200·B200 GPU와 개발사 권장 설정으로 모델을 서빙했고, GPQA-Diamond에서는 개발사 자가 보고 결과를 재현했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.