기존 KV 압축 기법 대비 최대 25% 추가 절감, 성능은 오히려 개선 — CASK
핵심 내용
core/scratch 분리로 reasoning KV cache를 더 작게, 더 정확하게 압축.
자세히 보기
LLM의 장문 reasoning에서 KV cache가 decode 길이에 따라 급격히 커지며 메모리와 추론 안정성을 압박합니다.
기존 reasoning용 KV compression은 주로 token importance scoring을 더 정교하게 만들어 낮은 순위를 버리는 방식이었지만, CASK는 이런 scorer 개선만으로는 실제 keep-set이 크게 재구성되지 않는다고 봅니다.
대신 behavior-preserving structured consolidation으로 문제를 다시 정의합니다.
- decode-time reasoning trace를 protected core와 mergeable scratch로 나눔
- core는 답 형성과 중간 상태를 떠받치는 영역으로 보존
- scratch에만 선택적 consolidation을 적용해 중복을 줄임
- prompt-heavy 환경에서는 decode compression이 늦게 시작될 수 있어, prefix eviction + decode-stage consolidation의 2단계 구조를 사용
평가에서는 H100 reasoning gate에서 TriAttention보다 같은 budget 기준 더 높은 full-KV continuation fidelity를 보였고, AIME24와 AIME25에서 cask@384 > triattention@512 교차가 반복적으로 나타났습니다.
prompt-heavy replay에서는 multi_news와 vcsum이 decode-active witness로 쓰였고, qmsum과 gov_report가 prefix budget exhausted 경계를 드러냈습니다.
핵심 결론은, reasoning KV compression의 성능은 더 복잡한 scorer engineering보다 core 보존 + scratch consolidation 조합에서 더 크게 나온다는 점입니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.