DeepSeek V4, 중국 최고 모델
CAISI releases evaluation report: DeepSeek V4 becomes the most powerful model in China, but still lags about 8 months behind the US frontier
·2026.05.03 12:10
핵심 내용
CAISI가 DeepSeek V4를 평가한 결과, 중국 최고 모델이지만 미국 프런티어보다 약 8개월 뒤처졌다.
1 / 2
자세히 보기
CAISI가 2026년 4월 오픈웨이트 모델 DeepSeek V4 Pro를 평가한 결과, 미국 프런티어보다 약 8개월 뒤처진 것으로 추정했다.
평가는 5개 분야와 9개 벤치마크를 중심으로 진행됐고, IRT 기반 비교에는 16개 벤치마크·35개 모델이 사용됐다. DeepSeek V4는 CAISI가 지금까지 평가한 중국(PRC) 최고 성능 모델로 분류됐다.
IRT추정 Elo는 800 ±28로, GPT-5.5(1260 ±28), Anthropic Opus 4.6(999 ±27)보다 낮았다.- 개발사 자체 벤치마크에서는 Opus 4.6·GPT-5.4와 비슷해 보였지만, CAISI의 비공개 벤치마크에서는 GPT-5 수준에 가까웠다.
- 특히 ARC-AGI-2 semi-private, PortBench, CTF-Archive-Diamond에서 미국 모델 대비 약세가 두드러졌다.
- 비용은 GPT-5.4 mini 대비 7개 중 5개 벤치마크에서 더 저렴했고, 범위는 53% 저렴~41% 비쌈이었다.
- CAISI는
H200·B200GPU와 개발사 권장 설정으로 모델을 서빙했고,GPQA-Diamond에서는 개발사 자가 보고 결과를 재현했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.