AI Briefing

FlashMemory DeepSeek-V4 Retriever (GitHub Repo)

·2026.06.10 09:00

DeepSeek-V4의 CSA KV-cache를 압축하여 GPU 메모리 효율을 극대화하는 경량 리트리버가 공개되었습니다.

FlashMemory DS-V4 Retriever는 DeepSeek-V4의 Compressed-Sparse-Attention (CSA) KV-cache를 희소화(sparsify)하는 경량 리트리버입니다.

디코드 토큰의 hidden state를 기반으로 다음 약 64개 토큰이 참조할 CSA KV-cache 청크를 예측합니다. 점수가 높은 상위 청크만 GPU에 유지하고, 나머지는 CPU나 디스크로 오프로드하여 메모리 사용량을 줄입니다. 이를 통해 전체 어텐션(full-attention) 방식과 유사한 성능을 유지하면서도 **KV-cache의 10~15%**만 온디바이스에 유지할 수 있습니다.

주요 특징 및 아키텍처:

  • 앙상블 방식: 3개의 독립적인 CSA 레이어(l10, l12, l20)에서 계산된 sigmoid 점수를 max 또는 mean 방식으로 결합하여 최종 결정 수행
  • 데이터 포맷: 각 청크는 132바이트의 uint8 형식으로 구성되며, 128바이트의 float8_e4m3 양자화된 키 값과 4바이트의 디퀀타이즈 스케일 값을 포함
  • 효율적인 추론: YaRN 기반의 RoPE와 Hadamard 변환을 거친 쿼리(q)를 사용하여 정밀한 스코어링 수행

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.