AI Briefing

KV 캐시 연구: LRU 대체 정책의 한계와 Capacity-bound 환경에서의 실패

·2026.09.10 22:39

핵심 내용

실제 에이전트 워크로드 시뮬레이션에서 LRU를 능가하는 KV 캐시 정책이 없음을 입증한 연구 결과가 발표됐다.

자세히 보기

LRU 대체 정책의 실패와 성능 저하

새로운 연구에 따르면, KV 캐시 관리를 위해 제안된 여러 대체 정책들이 실제 에이전트 워크로드에서 기존 **LRU(Least Recently Used)**를 능가하지 못하거나 오히려 성능을 저하시키는 것으로 나타났다. 393개 Claude Code 세션과 Mooncake trace 데이터를 기반으로 한 시뮬레이션 결과, Hazard 기반(H), Cost 기반(HC), Coherent 기반(HCG) 등 3가지 대안 정책 모두 LRU 대비 낮은 히트율을 기록했다. 특히 8,000 블록 기준 LRU의 히트율은 **83.48%**인 반면, 복합 정책(HCG) 적용 시 **68.63%**로 급감했다.

Capacity-bound 시나리오에서의 LRU 우위

실험은 용량 제한이 있는 Capacity-bound 환경에서 진행되었으며, 이 조건에서는 TTL(Time-To-Live) 만료보다 LRU 기반의 eviction이 먼저 발생하여 TTL 기반 정책이 효과를 발휘하지 못했다. 재계산(re-computation)의 주된 원인은 유휴 세션의 TTL 만료가 아니라, 2.1초의 중앙값 간격을 가진 짧은 tool-calling 루프였다. 원문은 이러한 긴밀한 루프가 캐시 미스의 지배적인 원인임을 강조하며, 긴 간격의 요청보다 훨씬 높은 비중을 차지한다고 설명한다.

연구의 한계 및 시사점

해당 연구는 GPU 실행 시간이나 지연 시간을 고려하지 않은 캐시 정책 전용 시뮬레이션이며, 데이터 규모(393개 세션)로 인한 일반화 한계가 존재한다. 연구진은 Capacity-bound 환경에서는 liveness prediction보다 compression이나 tiering 전략이 더 유효할 수 있음을 시사했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.