AI Briefing

DeepSeek V4 KV cache 사용량

The exact KV cache usage of DeepSeek V4

·2026.04.26 15:19

DeepSeek V4의 FP16 KV cache 사용량을 1M 컨텍스트 기준으로 재계산했다.

DeepSeek V4 논문 Figure 1의 KV cache 수치를 다시 계산해, 1M 컨텍스트에서의 실제 메모리 사용량을 정리했다.

  • V3.x(671B): 1M 토큰 기준 68.63GiB
  • V4 Flash(284B): 1M 토큰 기준 6.08GiB
  • V4 Pro(1600B): 1M 토큰 기준 8.71GiB

작성자는 DeepSeek V3.2의 MLA KV cache를 토큰당 1152바이트로 두고, 61개 레이어 기준 1M 토큰이면 68.625GiB가 맞다고 계산했다. 이를 기준으로 보면 V4의 KV cache 절감은 단순히 9.5배가 아니라 7.879배 수준이며, KV 비중 기준으로는 거의 20배 개선에 가깝다고 봤다.

또한 llama.cpp에서 지원될 경우, 충분한 RAM과 VRAM을 갖춘 시스템에서는 1M 컨텍스트 구동이 현실적일 수 있다고 전망했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.