0.23.01개월 전
v0.23.0
DeepSeek-V4 최적화 강화, Model Runner V2 지원 확대 및 Gemma 4 지원을 포함한 vLLM v0.23.0 업데이트
주요 업데이트 및 기능
- DeepSeek-V4 최적화 및 고도화: Sparse MLA 메타데이터 분리, TRTLLM-gen 어텐션 커널 추가, Mega-MoE를 위한 EPLB 지원, 슬라이딩 윈도우 KV 캐시의 선택적 프리픽스 캐시 유지 기능 등이 적용되어 성능이 대폭 개선되었습니다.
- Model Runner V2 (MRv2) 확장: 기존 Qwen3에 이어 Llama 및 Mistral 밀집(dense) 모델에서도 MRv2가 기본으로 선택됩니다. FlashInfer 샘플러, Breakable CUDA graphs, 파이프라인 병렬화 버블 제거 기능이 추가되었습니다.
- Gemma 4 지원: Gemma 4 Unified(encoder-free) 및 Gemma 4 MTP 지원이 추가되었으며, 정확도 및 시작 관련 버그가 수정되었습니다.
- Rust 프론트엔드 기능 강화: 스트리밍
generate엔드포인트, 동적 LoRA 엔드포인트,/version및/server_info엔드포인트가 추가되었으며, 다양한 도구 파서(InternLM2, Phi-4-mini, Gemma4 등)가 지원됩니다.
변경 사항 및 중단 예정 (Breaking Changes & Deprecations)
- Transformers v5 전환: vLLM이 Transformers v5를 타겟팅함에 따라, 기존 **v4 지원은 중단(deprecated)**될 예정입니다.
기타 주요 수정 사항
- Minimax M3 관련: 현재 이 버전에서는 Minimax M3를 지원하지 않으므로, 사용 시 별도의 가이드를 참조해야 합니다.