AI Briefing

초거대 LLM 실행을 위한 기반 구축

·2026.04.16 23:00

핵심 내용

Cloudflare는 PD disaggregation, prompt caching, KV-cache 최적화로 초거대 LLM 추론을 가속했다.

자세히 보기

Cloudflare는 Workers AI에서 Moonshot Kimi K2.5 같은 초거대 오픈소스 모델을 더 빠르고 효율적으로 돌리기 위해 인프라를 재설계했다. 공개 모델 출시 이후 사용 패턴을 다시 분석해, 입력 토큰 처리와 tool calling에 최적화된 구조로 전환했다.

가장 큰 축은 prefill decode disaggregation(PD disaggregation) 이다. prefill은 입력 토큰을 처리하며 KV cache를 채우는 단계이고, decode는 출력을 생성하는 단계인데, 전자는 compute-bound, 후자는 memory-bound라서 한 GPU에서 같이 처리하면 자원이 비효율적으로 묶인다. 그래서 Cloudflare는 prefill과 decode를 분리한 별도 inference server를 두고, token-aware load balancing으로 각 엔드포인트의 in-flight token 수를 분산한다.

이 구조는 요청 전달만이 아니라, prefill 서버의 cached token 정보를 decode 서버 응답과 streaming SSE에 다시 써 넣어야 하므로 로드 밸런서도 복잡해진다. 하지만 결과는 분명했다. 새 PD disaggregated 아키텍처로 트래픽을 옮긴 뒤 p90 Time to First Token이 떨어졌고, 요청량이 늘어나는 상황에서도 같은 GPU 수로 tail latency 변동성이 크게 줄었다. p90 time per token도 약 100 ms에서 20~30 ms 수준으로 내려가 약 3x 개선을 달성했다.

에이전트 워크로드용으로는 Prompt Caching도 강화했다. 긴 컨텍스트를 반복해서 보내는 특성을 고려해, 클라이언트가 x-session-affinity 헤더를 보내면 이전에 계산한 input tensor가 있던 region으로 라우팅해 prompt 재계산을 줄인다. 내부적으로는 KV-aware routing을 쓰면서, 외부에는 discounted cached tokens를 제공해 헤더 사용을 유도했고, 핵심 사용자들의 cache hit ratio를 **60% → 80%**로 끌어올렸다.

모델이 더 커지면서 하나의 인스턴스가 여러 GPU에 걸리게 되었고, KV-cache 공유가 또 다른 병목이 됐다. 이를 위해 Moonshot AI의 Mooncake Transfer Engine과 Mooncake Store를 활용해 GPU 간 직접 메모리 전송을 지원했고, LMCache나 SGLang HiCache와 결합해 클러스터 전체에서 cache를 공유하도록 만들었다. 덕분에 session-aware routing 의존도를 낮추고, cache를 NVMe까지 확장해 더 오래 유지할 수 있게 됐다.

추론 품질과 속도를 함께 잡기 위해 speculative decoding도 적용했다. 작은 draft model이 후보 토큰을 먼저 제안하고, 큰 target model이 이를 검증하는 방식이며, 특히 JSON 형태의 tool call처럼 구조가 예측 가능한 출력에서 효과가 크다. Kimi K2.5에는 NVIDIA EAGLE-3 draft model을 사용해, future token 수를 조절하면서 높은 품질을 유지한 채 tokens per second를 높였다.

핵심 엔진인 Infire도 초거대 모델용으로 크게 확장됐다. Infire는 Cloudflare의 분산 글로벌 네트워크에 맞춰 Rust로 작성된 inference engine이며, 이번에는 multi-GPU 지원을 추가해 pipeline parallelism, tensor parallelism, 그리고 expert parallelism까지 다루게 됐다. 메모리 오버헤드를 더 줄여 Llama 4 Scout는 H200 2장에서 56 GiB 이상의 KV-cache 여유를 확보했고, Kimi K2.5는 H100 8장으로 구동하면서도 30 GiB 이상이 남는다고 밝혔다.

부팅 속도도 개선돼, 가장 큰 모델도 20초 이내에 요청 처리를 시작할 수 있으며 로드 타임은 사실상 drive speed에 의해 제한된다. 이런 최적화의 결과로, Cloudflare는 unconstrained 시스템에서 tokens per second throughput 20% 향상을 얻었고, 이전엔 불가능했던 하드웨어 조합에서도 최신 모델을 실행할 수 있게 됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.