vLLM v0.28.0 공개, Kimi-K3 및 DeepSeek V4 최적화 대폭 강화
핵심 내용
vLLM v0.28.0은 Kimi-K3와 DeepSeek V4 모델에 대한 대규모 성능 최적화 및 추론 기능을 추가했다.
자세히 보기
vLLM v0.28.0 릴리스가 공개되었다. 이번 업데이트는 270명의 기여자가 참여한 584개의 커밋을 포함하며, 특히 Kimi-K3와 DeepSeek V4 모델에 대한 스택 전반의 최적화에 초점을 맞췄다.
Kimi-K3 성능 최적화
Kimi-K3 모델의 추론 속도와 메모리 효율성을 높이기 위해 여러 핵심 기술이 도입되었다. Decode Context Parallel (DCP) 지원과 함께 fused FlashKDA 디코딩 및 프리필 커널이 적용되었다. 또한 MegaMoE를 위한 SiTU activation 지원과 시퀀스 병렬화를 위한 GEMM-RS가 추가되었다. 커널 수준에서 1.5~3배의 속도 향상을 가져오는 결합 all-gathers와 DSpark TTFT를 약 60% 개선한 적응형 추측 토큰 예산 기능도 포함되었다. GPU당 약 17 GiB의 메모리를 절약하는 shared-expert sharding 옵션도 제공되며, ROCm 환경에서의 V2 모델 러너 지원도 추가되었다.
DeepSeek V4 및 추측 디코딩 개선
DeepSeek V4의 경우 sparse MLA가 plain decode, MTP, DSpark 추측 디코딩에서 엔드투엔드로 작동하도록 지원이 완료되었다. AMD Quark NVFP4 지원과 reasoning-effort 프롬프트 매핑이 추가되었으며, sparse top-k 메타데이터 커널 최적화와 eager CUDA graph 영역 축소 작업이 진행되었다. ROCm의 gfx11 및 gfx950 아키텍처 지원도 확장되었다.
추측 디코딩(speculative decoding) 분야에서는 DFlash2가 local convolution과 candidate selector를 도입했으며, DSpark는 confidence-scheduled verification을 지원한다. Draft 모델에 대해 async scheduling이 자동으로 활성화되도록 개선되었다. Model Runner V2는 E/P/D disaggregation을 지원하며 성숙도를 높이고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.