AI Briefing

Prefill-as-a-Service: 차세대 모델의 KVCache를 데이터센터 간으로 옮기다

·2026.04.20 09:00

핵심 내용

Hybrid-attention 모델의 작은 KVCache를 활용해 prefill을 데이터센터 밖으로 뺀다.

자세히 보기

대규모 LLM serving에서 prefill-decode(PD) disaggregation는 표준 아키텍처가 됐지만, 실제 배포 경계는 여전히 KVCache transfer가 정한다. 전통적인 dense-attention 모델은 KVCache 트래픽이 너무 커서 prefill과 decode를 하나의 고대역폭 네트워크 도메인 안에 묶어둘 수밖에 없었고, 그 결과 이기종 배치와 탄력적 자원 운용이 제한됐다.

최근의 hybrid-attention 계열 모델은 KVCache 크기를 크게 줄이면서 cross-datacenter 전송 가능성을 열었다. 하지만 KVCache가 작아졌다고 해서 곧바로 실용적인 것은 아니며, 실제 워크로드는 버스트성, 긴 요청 길이의 편차, prefix cache의 불균등 분포, inter-cluster bandwidth 변동까지 겹친다. 모든 prefill을 무작정 외부화하면 congestion과 queueing 불안정, 낮은 자원 활용으로 이어진다.

이에 따라 제안된 Prefill-as-a-Service(PrfaaS) 는 long-context prefill만 별도의 compute-dense prefill cluster로 오프로딩하고, 생성된 KVCache를 commodity Ethernet으로 local PD cluster에 전달하는 구조를 취한다. 핵심은 모델 차원의 KV 효율만 믿지 않고, 시스템 차원에서 selective offloading, bandwidth-aware scheduling, cache-aware request placement를 함께 적용하는 데 있다.

동작 방식은 다음과 같다.

  • length-based threshold routing으로 충분히 긴 요청만 prefill cluster로 보낸다.
  • bandwidth-aware scheduler가 링크 상태 변동을 감지해 혼잡이 쌓이기 전에 분산한다.
  • global KVCache manager와 hybrid prefix-cache pool이 요청 길이, cache 위치, cross-cluster bandwidth를 함께 고려한다.

이 설계는 heterogeneous accelerator가 같은 저지연 RDMA fabric을 공유하지 않아도 되게 만들어, prefill과 decode capacity를 서로 독립적으로 확장할 수 있게 한다. 즉, 하나의 tightly coupled cluster에 억지로 묶는 대신, 느슨하게 연결된 cluster나 datacenter, 지역 단위로 역할을 분리할 수 있다.

사례 연구에서는 1T-parameter hybrid model을 Kimi Linear 아키텍처를 따라 평가했다. standalone PrfaaS prefill cluster와 conventional PD decode cluster를 조합한 heterogeneous deployment는 homogeneous PD보다 serving throughput이 54%, naive heterogeneous baseline보다 32% 높았고, cross-datacenter bandwidth 사용량은 modest한 수준에 머물렀다.

결론적으로, 차세대 모델의 cross-datacenter serving은 모델이 KVCache를 줄였다는 사실만으로 성립하지 않는다. 실용화를 위해서는 KVCache reduction에 더해 요청 선택, 대역폭 인지 스케줄링, cache 배치까지 포함한 시스템 설계가 함께 필요하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.