AI Briefing

vLLM 대비 메모리 8배 절감, FastDMS 공개

FastDMS: 6.4X KV-cache compression running faster than vLLM BF16/FP8

·2026.05.05 06:38

KV-캐시 압축 기술인 DMS를 최적화하여 vLLM보다 메모리는 적게, 속도는 더 빠르게 구현한 FastDMS가 공개되었습니다.

NVIDIA와 여러 대학 연구진이 발표한 Dynamic Memory Sparsification (DMS) 기술을 최적화한 FastDMS가 MIT 라이선스로 공개되었습니다.

DMS는 학습된 per-head 토큰 제거 방식을 통해 KV-캐시를 최대 8배까지 압축할 수 있는 기술입니다. 기존의 참조 구현체는 속도가 느리다는 단점이 있었으나, FastDMS는 커널 최적화를 통해 이를 해결했습니다.

주요 성능 및 특징:

  • 메모리 효율성: 8K 컨텍스트 기준, vLLM BF16 대비 5~8배 적은 KV 메모리를 사용합니다.
  • 추론 속도: vLLM 대비 1.5~2배 빠른 디코딩 속도를 제공합니다.
  • 물리적 메모리 회수: 단순히 이론적인 압축에 그치지 않고, 제거된 슬롯의 메모리를 물리적으로 회수하는 Compact DMS 방식을 사용하여 실제 장치 메모리를 절약합니다.

이 프로젝트는 Qwen 3 8B 및 Llama 3.2 1B 모델에서 검증되었으며, GitHub를 통해 소스 코드와 트레이너를 확인할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.