AI Briefing

DeepSeek-V4 시리즈 공개

Deepseek-V4 is coming

·2026.04.24 13:00

DeepSeek-V4 프리뷰가 공개돼 1.6T MoE와 1M 컨텍스트를 지원한다.

DeepSeek가 DeepSeek-V4 프리뷰 버전을 Hugging Face에 공개했다.

시리즈는 두 모델로 구성된다.

  • DeepSeek-V4-Pro: 1.6T 파라미터, 49B 활성화, 1M 토큰 컨텍스트
  • DeepSeek-V4-Flash: 284B 파라미터, 13B 활성화, 1M 토큰 컨텍스트

핵심은 Hybrid AttentionmHC다. 1M 토큰 구간에서 DeepSeek-V3.2 대비 단일 토큰 추론 FLOPs를 **27%**로 줄이고, KV cache10% 수준으로 압축했다고 밝혔다.

또한 Muon Optimizer를 적용해 학습 안정성과 수렴 속도를 높였다고 설명했으며, 인스트럭트 모델은 Non-think / Think / Think Max 3단계 reasoning mode를 지원한다. 코드, 수학, 장문 컨텍스트 벤치마크 결과도 함께 공개됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.