더 작고 빠르고 안전하게: Kimi와 GLM을 대규모로 실행하기
Cloudflare가 Kimi와 GLM의 GPU 메모리 사용량을 줄이고 처리량을 높였다.
Cloudflare Workers AI는 사용자와 가까운 데이터센터의 GPU에서 Moonshot의 Kimi K 시리즈와 Z.ai의 GLM 같은 대규모·장문 컨텍스트·Mixture-of-Experts 모델을 서비스한다. 두 모델은 성능이 뛰어나지만 GPU 메모리 요구량이 커 효율적인 서빙이 어렵다.
Cloudflare는 SGLang 기반의 추론 환경에 세 가지 최적화를 적용했다.
- KV 캐시 양자화: BF16 대신 FP8을 사용해 KV 캐시 크기를 절반으로 줄였다. Kimi K2.6에서 메모리에 유지할 수 있는 컨텍스트가 약 68만6,000토큰에서 137만 토큰으로 늘었다.
- 모델 가중치 압축: GLM 5.2의 가중치를 FP8에서 INT4로 줄여 체크포인트를 705GB에서 421GB로 축소했다.
- 공유 캐시 보호: 더 많은 요청을 동일한 하드웨어에 수용하면서 공유 캐시를 보호하는 방식을 적용했다.
Kimi K2.6의 분산형 H200 디코딩 환경에서 FP8 KV 캐시는 요청 하나당 처리량이 BF16보다 소폭 낮았지만, BF16이 32개 동시 요청에서 메모리 부족을 일으킨 반면 FP8은 64개 요청까지 처리했다. 그 결과 최대 처리량은 초당 2,192토큰으로 BF16 최고치보다 약 41% 높았고, 토큰당 비용은 약 30% 줄었다.
프리필은 연산 중심이고 디코드는 메모리 중심인 특성을 고려해, 프리필 풀에서는 BF16 캐시를 유지하고 디코드 풀에 FP8을 적용했다. 평가 결과 FP8과 BF16 KV 캐시의 성능 차이는 사실상 없었으며, GSM8K·ARC·MMLU·도구 호출 유효성 등 주요 벤치마크에서도 정확도가 유지됐다.
모든 실험과 운영 트래픽은 오픈소스 추론 서빙 프레임워크 SGLang에서 실행됐다. Cloudflare는 SGLang 팀과 협력해 관련 패치와 기능을 오픈소스에 반영하고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.