0.29.02주 전
v0.29.0
핵심 내용
vLLM v0.29.0은 Model Runner V2의 기본 적용, Hy4-preview 및 Qwen3.8-Flash-Next 등 신규 모델 지원, 그리고 Kimi-K3와 DeepSeek V4의 성능 최적화를 포함한 대규모 업데이트를 출시했습니다.
자세히 보기
주요 변경 사항
🚀 주요 기능 및 아키텍처 변경
- Model Runner V2 (MRV2) 기본 적용: 모든 모델에서 MRV2가 기본 실행 엔진으로 설정되었습니다. 일부 ROCm 모델 및 미지원 기능을 제외하고 MRV1은 더 이상 기본값이 아닙니다.
- KV 캐시 자동 크기 조정: CUDA 그래프 메모리 프로파일링을 통해 KV 캐시 크기를 자동으로 최적화합니다.
- 메모리 효율성 향상: 배칭 샤드 샘플링(batch-sharded sampling)을 도입하여 단계별 로짓(logits) 메모리를 TP(텐서 병렬도)만큼 1/TP로 절감합니다.
- 추가 기능: 프롬프트 임베딩(prompt embeds),
extract_hidden_states추측(speculation), 균일한 디코딩을 위한 패딩된 FULL cudagraph 디스패치, EAGLE/MTP 초안 프리필(prefill) 전 DP 동기화 건너뛰기 지원.
🆕 신규 모델 지원
- Hy4-preview: Tencent의 770B 파라미터(활성 49B) MoE 모델로, Gated DeepSeek Sparse Attention과 네이티브 MTP를 지원합니다.
- Qwen3.8-Flash-Next: BF16, FP8, NVFP4 형식 및 MTP를 지원합니다.
- 기타 모델: GraniteSWA, GraniteMoeSWA, NemotronH_Omni_Reasoning_V3 (MTP 지원), Kimi K3 NVFP4 체크포인트.
⚡ 성능 최적화
- Kimi-K3 및 DeepSeek V4 최적화:
- Kimi-K3: MXFP4 top-k 최종화(finalization) 융합으로 엔드투엔드(E2E) 지연 시간 약 5% 감소, Mamba 메타데이터 준비를 단일 Triton 런치로 통합하여 커널 속도 6.6~7.6배 향상, Hopper 저지연 GEMM 튜닝(SM100 디스패치 포함)으로
eh_proj커널 속도 12.9~25.2% 향상. - DeepSeek V4: 공유 전문가(experts)를 MegaMoE에 융합, 적응형 top-k 너비 재도입, Humming MoE용 네이티브 SwiGLU 클램프 커널, 선택적 FlashInfer
moe_ep전문가 백엔드 지원.
- Kimi-K3: MXFP4 top-k 최종화(finalization) 융합으로 엔드투엔드(E2E) 지연 시간 약 5% 감소, Mamba 메타데이터 준비를 단일 Triton 런치로 통합하여 커널 속도 6.6~7.6배 향상, Hopper 저지연 GEMM 튜닝(SM100 디스패치 포함)으로
- 추측 디코딩(Speculative Decoding):
- OpenAI API 응답에서
--per-request-spec-decode-metrics플래그를 통해 요청별 수용 통계(acceptance stats) 제공. - 로그프로브(logprobs)에 대한 적응형 검증(adaptive verification) 확장.
- GLM-5.2 및 DeepSeek V4(SM90)용 SM100 희소 MLA(Sparse MLA) 지원.
- Qwen3-Omni용 DSpark 초안(drafts) 지원.
- OpenAI API 응답에서