KV 캐시 10배 압축하는 Shard 공개
Shard - getting to 10× KV cache compression
·2026.05.26 13:04
Llama-3.1-8B의 KV 캐시 메모리를 성능 저하 없이 약 10배 압축하는 Shard가 공개되었습니다.
Shard는 HuggingFace Cache의 드롭인(drop-in) 교체 모델로, Llama-3.1-8B 모델의 KV 캐시 메모리 사용량을 획기적으로 줄여줍니다.
8K 컨텍스트 기준 약 10배, 32K 컨텍스트 기준 약 11배의 압축률을 제공하며, NIAH(Needle In A Haystack)나 LongBench와 같은 벤치마크에서 유의미한 성능 저하 없이 동작합니다.
주요 기술적 특징은 다음과 같습니다:
- K (Key) 행렬: RoPE를 해제한 후 **PCA(주성분 분석)**와 int4 양자화를 적용하여 저차원 행렬로 처리합니다.
- V (Value) 행렬: Hadamard 회전과 **벡터 양자화(Vector Quantization)**를 적용합니다.
- 직접 연산: Attention 연산 시 fp16으로 재구성하는 과정 없이, 압축된 K 상태에서 직접 연산을 수행합니다.
해당 프로젝트의 소스 코드는 GitHub(krish1905/shard)에서 확인할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.