DeepSeek V4, 중국 최고 모델
CAISI releases evaluation report: DeepSeek V4 becomes the most powerful model in China, but still lags about 8 months behind the US frontier
·2026.05.03 12:10
CAISI가 DeepSeek V4를 평가한 결과, 중국 최고 모델이지만 미국 프런티어보다 약 8개월 뒤처졌다.
CAISI가 2026년 4월 오픈웨이트 모델 DeepSeek V4 Pro를 평가한 결과, 미국 프런티어보다 약 8개월 뒤처진 것으로 추정했다.
평가는 5개 분야와 9개 벤치마크를 중심으로 진행됐고, IRT 기반 비교에는 16개 벤치마크·35개 모델이 사용됐다. DeepSeek V4는 CAISI가 지금까지 평가한 중국(PRC) 최고 성능 모델로 분류됐다.
IRT추정 Elo는 800 ±28로, GPT-5.5(1260 ±28), Anthropic Opus 4.6(999 ±27)보다 낮았다.- 개발사 자체 벤치마크에서는 Opus 4.6·GPT-5.4와 비슷해 보였지만, CAISI의 비공개 벤치마크에서는 GPT-5 수준에 가까웠다.
- 특히 ARC-AGI-2 semi-private, PortBench, CTF-Archive-Diamond에서 미국 모델 대비 약세가 두드러졌다.
- 비용은 GPT-5.4 mini 대비 7개 중 5개 벤치마크에서 더 저렴했고, 범위는 53% 저렴~41% 비쌈이었다.
- CAISI는
H200·B200GPU와 개발사 권장 설정으로 모델을 서빙했고,GPQA-Diamond에서는 개발사 자가 보고 결과를 재현했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.