AI Briefing

KV캐시 무용론

[Paper] Residual Streams / KV Direct

·2026.04.15 04:04

핵심 내용

KV cache 없이 residual stream만 저장해도 동일 출력을 낼 수 있다고 주장한다.

자세히 보기

Transformer 추론에서 KV cache가 필수 상태라는 통념에 반해, 키와 값은 각 층의 residual stream에서 결정적으로 복원 가능하다고 주장한다.

논문은 6개 모델, 4개 아키텍처 계열, 135M~4B 파라미터 범위에서 이를 검증했고, 복원 오차는 bit-identical 수준이라고 설명한다.

또한 layer별 cross-task residual patching에서 D KL = 0이 관측돼, residual stream이 사실상 유일한 정보 상태이며 Markov property를 만족한다고 해석한다.

이 결과를 바탕으로 KV-Direct를 제안한다.

  • 토큰당 전체 KV 대신 residual vector만 체크포인트 저장
  • Gemma 3-4B 기준 5 KB/token으로 메모리 절감
  • 기존 KV pair 대비 136 KB/token 수준과 비교
  • 20턴 대화에서 peak memory를 42 MB로 유지, 표준 cache는 103 MB를 넘김

비교 대상으로는 H2O, StreamingLLM, SnapKV, TOVA, window-only를 두었고, KV-Direct는 모든 cache budget에서 100% token match를 유지했다고 적었다. 반면 baselines는 5~28% 수준으로 성능이 떨어졌다고 주장한다.

또한 재계산 방식이 cached tensor를 읽는 것보다 일부 연산에서 최대 5배 빠르다고 분석해, 메모리 절감뿐 아니라 추론 효율 측면의 가능성도 제시한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.