0.30.04일 전
v0.30.0
핵심 내용
vLLM v0.30.0은 Model Runner V2의 초기화 시간 3배 단축, DeepSeek-V4.1-Flash 및 GLM-5.3-Flash 등 신규 모델 지원, 그리고 Scale-out 및 GPTQ 관련 호환성 변경을 포함한 대규모 업데이트를 출시했다.
자세히 보기
주요 성능 개선 및 아키텍처 변경
- Model Runner V2 최적화: Dual-batch overlap과 MTP/EAGLE3 speculative decoding 도입으로 graph capture 시간을 12초에서 2초로, 초기화 시간을 28.9초에서 8.2초(H200 기준)로 대폭 단축.
- Fast Start 기능: GPU weight-cache daemon 도입으로
--load-format ipc_cache지원. FP4 체크포인트 및 multi-node TP 환경에서 적용 가능. - NVIDIA 플랫폼: DeepGEMM 2.8.0(SM120/90), CUDA 13.4 Rubin 지원, H20 MoE 성능 21% 향상, NVFP4 KV FMHA 가속.
- AMD 플랫폼: ROCm 10.0 및 AITER 0.1.21을 통해 DSv3 QPS 4~8% 개선, Gemma4 AWQ의 TPOT 26% 단축.
- CPU 백엔드: DeepSeek-V4 백엔드 지원, Diamond Rapids용 AMX-FP8 attention 최적화, Arm LM head 성능 약 6% 향상.
신규 모델 및 양자화 지원
- 신규 모델: DeepSeek-V4.1-Flash(MXFP8, SM100), GLM-5.3-Flash, K2-Horizon, Cohere Compass 등 지원.
- 양자화 기술: SM100/103에서 FlashInfer CuTeDSL NVFP4 W4A16가 Marlin 대체, AutoRound의 2~7bit CUDA 지원 추가, Online quantization, W4A16 DSA, NVFP4, FP8 MoE 신규 지원.
- 모델별 최적화: GLM-5.3-Flash의 FlashKDA(1.7~3.8배 가속), Qwen3.8-Flash-Next의 fused PLE 및 FP8 indexer cache, Kimi K3의 NVFP4 DeepGEMM 및 SM100 CUDA AttnRes 적용.
Breaking Changes 및 호환성 변경
- Scale-out:
--enable-scale-out옵션이 기본 비활성화(opt-in) 방식으로 전환됨. - GPTQ:
g_idx제거. - YaRN: Alias가
max_model_len을 재조정하지 않도록 변경(TeleChat3의 경우 131k에서 32k로 감소). - DCP: Distributed Context Parallelism 사용 시 명시적 선언 필수.
- Audio: Resampler 기본값이 PyAV에서 torchaudio로 변경.
- Deprecated 항목 삭제:
VLLM_PREFIX_CACHE_RETENTION_INTERVAL등 0.29 버전의 deprecated 항목 및allMamba cache mode 삭제. - Known Issue: ROCm standard/Triton/FlexAttention/TurboQuant에서 backend selection 실패(#55780) 발생. MoRI-IO WRITE와 hybrid KV cache 병용 시
--disable-hybrid-kv-cache-manager필요.
기능 추가 및 API 개선
- API:
/v1/responses/render, scale-out, reasoning_tokens, MFU/MBU 메트릭 지원. Cohere parser 통합으로 OpenAI/Anthropic/Cohere 호환성 개선. - Rust Frontend: TLS,
--lora-modules, HTTP RL 동기화 지원. - Speculative Decoding: EAGLE3 Sarvam MLA, Nemotron-H MTP, NVFP4 DSpark 추가. Adaptive verification이 FLASHINFER_MLA_SPARSE_DSV4에서 활성화.
- Watermarking: Speculative decoding과 호환되는 Gumbel-max 방식 채택.
보안 및 안정성
- 보안 패치: Validation error 응답 증폭(약 5,300배) 차단, Sparse embedding 바운딩, GLMGA/Qwen-VL 비디오 샘플링 제한, Cache_salt 검증 적용.
- Stability: Zero-progress preemption cascades 방지, Sleep mode에서 NCCL 메모리 해제 및 dummy forward 제거, CUDA graph fallback 및 pinned H2D copy 개선.