0.24.01개월 전
v0.24.0
vLLM v0.24.0은 MiniMax-M3 지원, DeepSeek-V4 최적화, Model Runner V2 기능 확장 및 새로운 스트리밍 파서 엔진 도입을 포함합니다.
주요 기능 및 모델 지원
- MiniMax-M3 모델 지원 추가: BF16/FP8 인덱서, MXFP4 지원 및 AMD/ROCm 환경을 위한 광범위한 튜닝(mxfp8 MoE/linear, fp8_per_channel 등) 포함
- DeepSeek-V4 최적화 지속: FlashInfer sparse index cache, prefill chunk-planning, cluster-cooperative topK 커널 등을 통해 성능 향상 및 SM120 지원
- Model Runner V2 (MRv2) 확장: 양자화된 모델(quantized models) 기본 지원, GraniteMoE 기본 지원, Qwen 및 DeepSeek-V2 MoE 모델 마이그레이션 완료
- Streaming Parser Engine 도입: 도구 호출(tool-call) 및 추론(reasoning) 파싱을 통합한 새로운 엔진 추가 (Qwen3, MiniMax-M2, GLM-4.7/5.1/5.2, Nemotron V3 지원)
- Diffusion LLMs: DiffusionGemma 지원 추가 (CPU 경로 및 구조화된 출력 가드레일 포함)
- DeepEP v2 통합: 전문가 병렬성(expert parallelism)을 위한 DeepEP v2 통합
성능 개선 및 버그 수정
- DeepSeek-V4 성능 최적화: TTFT(첫 토큰 생성 시간) 2–4% 개선 및 전체 엔드투엔드(E2E) 처리량 4% 향상
- MiniMax-M2 성능 저하(performance regression) 이슈 수정
- FP8 KV-cache 관련 수정 사항 반영