DeepSeek-V4 시리즈 공개
Deepseek-V4 is coming
·2026.04.24 13:00
핵심 내용
DeepSeek-V4 프리뷰가 공개돼 1.6T MoE와 1M 컨텍스트를 지원한다.
자세히 보기
DeepSeek가 DeepSeek-V4 프리뷰 버전을 Hugging Face에 공개했다.
시리즈는 두 모델로 구성된다.
- DeepSeek-V4-Pro: 1.6T 파라미터, 49B 활성화, 1M 토큰 컨텍스트
- DeepSeek-V4-Flash: 284B 파라미터, 13B 활성화, 1M 토큰 컨텍스트
핵심은 Hybrid Attention과 mHC다. 1M 토큰 구간에서 DeepSeek-V3.2 대비 단일 토큰 추론 FLOPs를 **27%**로 줄이고, KV cache는 10% 수준으로 압축했다고 밝혔다.
또한 Muon Optimizer를 적용해 학습 안정성과 수렴 속도를 높였다고 설명했으며, 인스트럭트 모델은 Non-think / Think / Think Max 3단계 reasoning mode를 지원한다. 코드, 수학, 장문 컨텍스트 벤치마크 결과도 함께 공개됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.