0.27.01개월 전
v0.27.0
핵심 내용
vLLM v0.27.0은 Kimi K3·Qwen3.5 지원, PyTorch 2.13 업그레이드, FlashAttention 4 및 DeepSeek-V4 성능 개선, Model Runner V2 확장을 포함한 대규모 릴리스입니다.
자세히 보기
주요 기능
- Kimi K3 전체 스택을 지원합니다. 코어 모델 파일과 커널, Python·Rust 프론트엔드, AttnRes 커널, DeepGEMM, compressed-tensors 양자화 체크포인트, DSpark AR fusion을 포함합니다.
- Kimi K3에서 공유 expert를 복제하는 대신 샤딩할 수 있는 옵션을 제공합니다.
- Qwen3.5 텍스트 전용 dense 및 MoE 모델을 지원하며, EVS 비디오 토큰 프루닝을 추가했습니다.
- K-EXAONE-2.0-750B-A37B, Transformers modeling backend를 통한 VaultGemma, jina-embeddings-v5-text-nano를 지원합니다.
- Model Runner V2가 생성형 작업을 넘어 encoder-only attention, 임베딩·분류용 sequence pooling, encoder token classification, token embedding, BGE-M3 pooling을 지원합니다.
- Model Runner V2에 CPU 멀티모달 처리와 multi-layer MTP speculator 지원을 추가했습니다.
호환성 및 주요 변경
- PyTorch 2.13.0, torchvision 0.28.0, Triton 3.7.1로 업그레이드했습니다.
- 이번 PyTorch 업그레이드는 환경 호환성을 깨뜨리는 변경 사항입니다. XPU와 CPU도 torch 2.13으로 업데이트되었습니다.
성능 개선
- FlashAttention 4의 SM100 지원을 강화해 FP8 KV 캐시와 headdim-256을 지원합니다.
- JIT warmup 인프라와 runner 소유 Triton 커널 warmup을 도입해 첫 요청에서 발생하던 컴파일 지연을 줄였습니다.
- DeepSeek-V4에 sequence parallelism을 추가했습니다.
- DeepSeek-V4에서 빈 c128 커널 실행 생략, 불필요한 topk/router 계산 제거, workspace 재사용, 중복 full kernel 제거, adaptive topk width를 적용해 커널 및 E2E TTFT 성능을 개선했습니다.
- DeepSeek-V4의 PP 버퍼에서 448 MiB의 GPU 메모리를 절약하고, compact MXFP4 indexer KV 캐시를 추가했습니다.
- FlashInfer >= 0.6.14에서 sparse-MLA q-head padding을 제거했습니다.
기타
- 제공된 변경 내역에는 별도의 주요 deprecation 또는 removal 항목이 명시되어 있지 않습니다.