0.28.01개월 전
v0.28.0
핵심 내용
vLLM v0.28.0은 Kimi-K3 및 DeepSeek V4의 성능 최적화, 추측 디코딩(Speculative Decoding) 고도화, 그리고 Model Runner V2의 성숙도를 크게 향상시켰습니다.
자세히 보기
주요 기능 및 성능 향상
- Kimi-K3 최적화: Decode Context Parallel(DCP) 지원, FlashKDA 디코드/프리필 키널 융합, MegaMoE용 SiTU 활성화, 시퀀스 병렬화를 위한 GEMM-RS 도입. All-gather 결합으로 1.5~3배 커널 속도 향상, 적응형 추측 토큰 버짓으로 DSpark TTFT 약 60% 개선, 선택적 공유 전문가 샤딩으로 GPU당 약 17 GiB 메모리 절감. ROCm V2 모델 러너 지원 추가.
- DeepSeek V4 엔드투엔드 지원: 일반 디코드, MTP, DSpark 추측 디코딩을 위한 스파스 MLA(Sparse MLA) 지원. AMD Quark NVFP4 지원, 추론 노력(reasoning-effort) 프롬프트 매핑, 스파스 top-k 메타데이터 커널 최적화, Eager CUDA 그래프 영역 축소, gfx11/gfx950 기반 ROCm 활성화.
- 추측 디코딩(Speculative Decoding) 진전: 로컬 컨볼루션 및 후보 선택기를 갖춘 DFlash2, 신뢰도 기반 검증 스케줄링을 갖춘 DSpark, 드래프트 모델을 위한 비동기 스케줄링 자동 활성화.
- Model Runner V2 성숙도 향상: E/P/D 디아그리게이션(분리 처리), 웨이트 오프로딩, 멀티레이어 MTP KV 캐시 지원, 인코더 CUDA 그래프, 디코더 토큰 단위 풀링, Transformers 풀링 모델 지원, 어텐션 없는 모델 지원,
thinking_token_budget지원. - 티어 기반 KV 캐시 오프로딩: 디스크 오프로딩 지원,
module_path를 통한 트리아웃(Out-of-tree) 2차 티어 매니저, 부분적 2차 티어 로드 결과 처리, 티어링 메트릭, 병렬성 무관 오프로딩을 위한 정형화된 CPU 레이아웃. - Rust 프론트엔드 및 gRPC: 독립 렌더러, gRPC를 통한 멀티모달 이미지 추론 지원.