버스트형 LLM 추론을 위한 예측적 Speculative KV Replication
핵심 내용
BTB가 반복 프리픽스 버스트를 예측해 KV 캐시를 GPU HBM에 선제 복제한다.
자세히 보기
LLM 추론 서비스에서는 데이터 라벨링이나 다중 에이전트 fan-out처럼 동일한 긴 프리픽스를 공유하는 요청이 갑자기 몰리는 버스트가 발생할 수 있다. 저자들은 공개 트레이스가 이런 패턴을 충분히 반영하지 못하며, 기존 GPU 라우팅 정책도 해당 환경에서 비효율적이라고 지적한다.
GitHub 프로젝트 Biting the Bullet(BTB) 는 대규모 요청 버스트를 예측한 뒤, RDMA를 통해 이미 계산된 프리픽스 KV cache를 다른 GPU의 HBM으로 선제 복제한다. 요청이 도착한 후 캐시를 옮기거나 프리필을 다시 수행하는 대신, GPU 메모리에 미리 배치해 초기 응답 지연을 줄이는 방식이다.
Llama-3.3-70B 기준으로 KV cache는 토큰당 약 320KiB이며, 1,000토큰 프리픽스는 약 320MiB에 해당한다. 동일한 프리픽스가 정확히 일치해야 캐시를 재사용할 수 있으므로, 프리픽스 초반의 토큰 하나만 달라도 공유가 중단된다.
저자들이 제시한 4×H100 노드 환경의 8,000토큰 프리픽스 처리 시간은 다음과 같다.
- GPU HBM: 약 0.20ms
- 호스트 RAM: 약 11.9ms
- RDMA 원격 GPU: 약 13.1ms
- NVMe: 약 374ms
- 재계산(prefill): 약 571ms
BTB는 SGLang의 기본 cache-aware router와 비교해 평균 time to first token을 10~60%, 최적 조건에서 p95 time to first token을 최대 80~82% 줄였다고 보고했다. 핵심 전제는 반복되는 긴 프리픽스와 버스트 도착을 사전에 감지할 수 있다는 점이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.