AI Briefing

기존 KV 압축 기법 대비 최대 25% 추가 절감, 성능은 오히려 개선 — CASK

·2026.04.15 00:16

핵심 내용

core/scratch 분리로 reasoning KV cache를 더 작게, 더 정확하게 압축.

자세히 보기

LLM의 장문 reasoning에서 KV cache가 decode 길이에 따라 급격히 커지며 메모리와 추론 안정성을 압박합니다.

기존 reasoning용 KV compression은 주로 token importance scoring을 더 정교하게 만들어 낮은 순위를 버리는 방식이었지만, CASK는 이런 scorer 개선만으로는 실제 keep-set이 크게 재구성되지 않는다고 봅니다.

대신 behavior-preserving structured consolidation으로 문제를 다시 정의합니다.

  • decode-time reasoning trace를 protected core와 mergeable scratch로 나눔
  • core는 답 형성과 중간 상태를 떠받치는 영역으로 보존
  • scratch에만 선택적 consolidation을 적용해 중복을 줄임
  • prompt-heavy 환경에서는 decode compression이 늦게 시작될 수 있어, prefix eviction + decode-stage consolidation의 2단계 구조를 사용

평가에서는 H100 reasoning gate에서 TriAttention보다 같은 budget 기준 더 높은 full-KV continuation fidelity를 보였고, AIME24와 AIME25에서 cask@384 > triattention@512 교차가 반복적으로 나타났습니다.

prompt-heavy replay에서는 multi_news와 vcsum이 decode-active witness로 쓰였고, qmsum과 gov_report가 prefix budget exhausted 경계를 드러냈습니다.

핵심 결론은, reasoning KV compression의 성능은 더 복잡한 scorer engineering보다 core 보존 + scratch consolidation 조합에서 더 크게 나온다는 점입니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.