KV 캐시 압축을 위한 TriAttention (GitHub 저장소)
·2026.04.08 09:00
TriAttention은 삼각함수 기반 압축을 통해 정확도 손실 없이 KV 캐시를 10.7배 압축하고 처리량을 2.5배 향상시킨다.
TriAttention은 삼각함수 주파수 영역 압축(trigonometric frequency-domain compression)을 활용하여 긴 추론(long reasoning) 작업 시 발생하는 KV 캐시 문제를 해결한다.
기존의 어텐션 기반 방식과 달리, TriAttention은 대표 쿼리를 별도로 선택하는 오버헤드 없이 pre-RoPE Q/K 벡터의 중심점과 노름(norm)을 사용하여 키(key)를 점수화한다. 이를 통해 정확도를 유지하면서도 매우 효율적인 압축이 가능하다.
주요 성능 지표는 다음과 같다:
- 10.7배 KV 메모리 절감
- 2.5배 처리량(throughput) 향상 (AIME25 벤치마크 기준)
- Full Attention과 동일한 정확도 유지
또한, Apple Silicon(MLX), AMD GPU(llama.cpp), vLLM 등을 지원하며, OpenClaw와 호환되어 RTX 4090(24GB)과 같은 로컬 환경에서도 원활한 배포가 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.