AI Briefing

DeepSeek v4

·2026.04.24 15:18

DeepSeek-V4가 1M 토큰 컨텍스트와 코딩 벤치마크를 내세워 공개됐다.

DeepSeek가 1M 토큰 컨텍스트를 지원하는 DeepSeek-V4 시리즈를 공개했다. 모델은 V4-Pro(총 1.6T, 활성 49B)와 V4-Flash(총 284B, 활성 13B) 두 가지이며, 둘 다 Hugging Face와 ModelScope에서 내려받을 수 있다.

핵심 아키텍처는 CSAHCA를 결합한 하이브리드 어텐션이다. 100만 토큰 기준으로 DeepSeek-V3.2 대비 단일 토큰 추론 FLOPs를 **27%**로 낮추고, KV 캐시 사용량도 10% 수준으로 줄였다. 여기에 mHC 연결과 Muon optimizer를 더해 신호 전파 안정성과 수렴 속도를 개선했다.

학습은 32T+ 토큰 사전학습 뒤 2단계 후학습으로 진행됐다.

  • 1단계: SFT + RL(GRPO) 로 도메인별 전문가를 개별 학습
  • 2단계: on-policy distillation 으로 전문가 능력을 단일 모델에 통합

추론 모드는 Non-Think, Think High, Think Max 세 가지다. 모드를 올릴수록 성능이 올라가며, V4-Pro-Max는 코딩과 에이전트 태스크에서 강세를 보였다.

벤치마크에서는 LiveCodeBench 93.5, SWE Verified 80.6, Codeforces 3206을 기록했고, Base 모델도 MMLU 90.1, HumanEval 76.8, LongBench-V2 51.5 등으로 V3.2 계열을 앞섰다. 배포용 정밀도는 Base 모델이 FP8 Mixed, Instruct 모델이 FP4 + FP8 Mixed이며, 채팅 템플릿 대신 OpenAI 호환 인코딩/파싱 스크립트를 제공한다. 라이선스는 MIT다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.