버스트형 LLM 추론을 위한 예측적 Speculative KV Replication
BTB가 반복 프리픽스 버스트를 예측해 KV 캐시를 GPU HBM에 선제 복제한다.
LLM 추론 서비스에서는 데이터 라벨링이나 다중 에이전트 fan-out처럼 동일한 긴 프리픽스를 공유하는 요청이 갑자기 몰리는 버스트가 발생할 수 있다. 저자들은 공개 트레이스가 이런 패턴을 충분히 반영하지 못하며, 기존 GPU 라우팅 정책도 해당 환경에서 비효율적이라고 지적한다.
GitHub 프로젝트 Biting the Bullet(BTB) 는 대규모 요청 버스트를 예측한 뒤, RDMA를 통해 이미 계산된 프리픽스 KV cache를 다른 GPU의 HBM으로 선제 복제한다. 요청이 도착한 후 캐시를 옮기거나 프리필을 다시 수행하는 대신, GPU 메모리에 미리 배치해 초기 응답 지연을 줄이는 방식이다.
Llama-3.3-70B 기준으로 KV cache는 토큰당 약 320KiB이며, 1,000토큰 프리픽스는 약 320MiB에 해당한다. 동일한 프리픽스가 정확히 일치해야 캐시를 재사용할 수 있으므로, 프리픽스 초반의 토큰 하나만 달라도 공유가 중단된다.
저자들이 제시한 4×H100 노드 환경의 8,000토큰 프리픽스 처리 시간은 다음과 같다.
- GPU HBM: 약 0.20ms
- 호스트 RAM: 약 11.9ms
- RDMA 원격 GPU: 약 13.1ms
- NVMe: 약 374ms
- 재계산(prefill): 약 571ms
BTB는 SGLang의 기본 cache-aware router와 비교해 평균 time to first token을 10~60%, 최적 조건에서 p95 time to first token을 최대 80~82% 줄였다고 보고했다. 핵심 전제는 반복되는 긴 프리픽스와 버스트 도착을 사전에 감지할 수 있다는 점이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.