DeepSeek v4
핵심 내용
DeepSeek-V4가 1M 토큰 컨텍스트와 코딩 벤치마크를 내세워 공개됐다.
자세히 보기
DeepSeek가 1M 토큰 컨텍스트를 지원하는 DeepSeek-V4 시리즈를 공개했다. 모델은 V4-Pro(총 1.6T, 활성 49B)와 V4-Flash(총 284B, 활성 13B) 두 가지이며, 둘 다 Hugging Face와 ModelScope에서 내려받을 수 있다.
핵심 아키텍처는 CSA와 HCA를 결합한 하이브리드 어텐션이다. 100만 토큰 기준으로 DeepSeek-V3.2 대비 단일 토큰 추론 FLOPs를 **27%**로 낮추고, KV 캐시 사용량도 10% 수준으로 줄였다. 여기에 mHC 연결과 Muon optimizer를 더해 신호 전파 안정성과 수렴 속도를 개선했다.
학습은 32T+ 토큰 사전학습 뒤 2단계 후학습으로 진행됐다.
- 1단계: SFT + RL(GRPO) 로 도메인별 전문가를 개별 학습
- 2단계: on-policy distillation 으로 전문가 능력을 단일 모델에 통합
추론 모드는 Non-Think, Think High, Think Max 세 가지다. 모드를 올릴수록 성능이 올라가며, V4-Pro-Max는 코딩과 에이전트 태스크에서 강세를 보였다.
벤치마크에서는 LiveCodeBench 93.5, SWE Verified 80.6, Codeforces 3206을 기록했고, Base 모델도 MMLU 90.1, HumanEval 76.8, LongBench-V2 51.5 등으로 V3.2 계열을 앞섰다. 배포용 정밀도는 Base 모델이 FP8 Mixed, Instruct 모델이 FP4 + FP8 Mixed이며, 채팅 템플릿 대신 OpenAI 호환 인코딩/파싱 스크립트를 제공한다. 라이선스는 MIT다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.