PagedAttention: KV 캐시를 위한 가상 메모리
·2026.08.21 09:00
핵심 내용
PagedAttention은 가상 메모리 개념을 적용해 LLM 추론 시 KV 캐시 메모리 낭비를 크게 줄인다.
자세히 보기
LLM 추론 시스템에서 KV 캐시는 시퀀스 길이에 따라 선형적으로 증가하여 GPU 메모리의 가장 큰 점유 요소가 된다. 기존 방식은 각 요청에 대해 최대 컨텍스트 길이를 미리 할당하는 연속 메모리 할당 방식을 사용해, 실제 사용량이 적어도 메모리를 낭비하는 내부 단편화와 요청 종료 후 남은 공간이 조각나 발생하는 외부 단편화 문제를 겪는다.
PagedAttention은 운영체제의 가상 메모리 개념을 KV 캐시 관리에 적용하여 이 문제를 해결한다. 고정된 크기의 블록으로 메모리를 나누고 필요할 때만 할당하는 방식을 통해, vLLM 논문에서 보고된 실제 워크로드의 20~40%였던 KV 캐시 활용률을 크게 개선한다. 이를 통해 GPU당 처리할 수 있는 사용자 수를 2~4배까지 늘리는 효율성을 달성한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.