0.25.03주 전
v0.25.0
vLLM v0.25.0은 Model Runner V2를 기본값으로 채택하고 PagedAttention를 제거하며, 모델 지원 확대 및 성능 최적화를 달성했습니다.
주요 변경 사항
Breaking Changes & Deprecations
- PagedAttention 제거: V1 및 MRv2 백엔드가 표준화됨에 따라 레거시 어텐션 구현이 삭제되었습니다.
Major New Features
- Model Runner V2 (MRv2) 기본 적용: 모든 Dense 모델에 대해 MRv2가 기본 실행 경로로 설정되었습니다. EVS, 실시간 임베딩, Mamba 하이브리드 모델을 위한 Prefix Caching, 멀티모달-prefix 양방향 어텐션, CUDA Graph 호환 동적 투기적 디코딩(Dynamic Speculative Decoding)을 지원합니다.
- Streaming Parser Engine 도입: 도구 호출(Tool-call) 및 추론 파싱을 위한 통합 프레임워크가 추가되었습니다. Kimi k2.5/k2.6/k2.7 파서 및 DeepSeek V4 포팅이 포함됩니다.
- Universal Speculative Decoding: 이종 어휘집(Heterogeneous vocabularies)을 위한 TLI 지원 및 새로운 DSpark, DFlash 드래프터가 추가되었습니다.
- 신규 모델 지원: LLaVA-OneVision-2, Unlimited OCR, MOSS-Transcribe-Diarize, openai/privacy-filter, Hy3, GLM-5, DeepSeek-V3.2, MiniMax-M3 등이 추가되었습니다.
Performance Improvements
- Transformers modeling backend 최적화: 이제 네이티브 vLLM과 동일한 수준의 속도를 제공하며, FP8 MoE 지원 및 CUDA Graph 관련 수정 사항이 반영되었습니다.
- MiniMax-M3 성능 향상: 파이프라인 병렬화(Pipeline parallelism) 및 NVFP4 지원이 추가되었습니다.