CachyLLama, SSD 기반 KV 캐싱 지원
CachyLLama: llama.cpp fork with persistent SSD-backed KV caching for local agent workflows
·2026.07.25 22:11
llama.cpp의 포크 버전인 CachyLLama가 SSD를 활용한 KV 캐싱으로 프롬프트 처리 속도를 혁신적으로 개선했다.
로컬 에이전트(Aider, Claude Code 등) 실행 시 발생하는 프롬프트 재평가(Prompt Evaluation) 병목 현상을 해결하기 위해 개발된 llama.cpp 포크 프로젝트입니다.
주요 특징은 다음과 같습니다:
- 지속 가능한 On-Disk KV 캐시: 대화 상태를 SSD에 저장하여 서버 재시작이나 전원 차단 후에도 상태를 유지하며, 콜드 스타트 시 디스크에서 즉시 복구합니다.
- 전용 시스템 프롬프트 캐시: 정적 접두사(Static Prefixes)를 위한 글로벌 캐시를 유지하여 반복되는 시스템 프롬프트 재평가를 생략합니다.
- 하이브리드 MoE/SSM 지원: Qwen 3.5/3.6, Gemma 4, DeepSeek-V3 등 최신 아키텍처의 recurrent state와 attention cell을 정확하게 추적하고 복구합니다.
- 멀티 티어링(Multi-Tiering): 활성 상태는 RAM에 유지하고, 유휴 세션은 디스크로 내리며, 커널 readahead를 통해 디스크 I/O와 연산을 오버랩합니다.
벤치마크 결과, 약 15,700 토큰 크기의 프롬프트 처리 시 기존 **143.1초(Cold Start)**가 걸리던 작업이 캐시 활용 시 **0.99초(Warm)**로 단축되는 성능을 보였습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.