0.26.01주 전
v0.26.0
vLLM v0.26.0은 Inkling 모델 패밀리 지원, DeepSeek-V4 성능 최적화, 그리고 KV 캐시 오프로딩 기능 강화를 핵심으로 합니다.
주요 기능 및 모델 지원
- Inkling 모델 패밀리 전격 지원: 베이스 모델링, CUDA graph, Hopper FA4 상대적 어텐션, MTP=1 투기적 디코딩(Speculative Decoding), LoRA, ModelOpt NVFP4 양자화를 포함한 풀 스택 지원.
- 유연한 어텐션 백엔드: KV-cache 그룹별로 어텐션 백엔드 선택이 가능해졌으며, 슬라이딩 윈도우(Sliding-window) 지원이 명시적인 백엔드 기능으로 추가되어 하이브리드 모델 지원이 강화됨.
- Transformers 5.13.0 업데이트: Olmo/Olmo2, MistralLarge3, HunyuanVL 등 더 많은 모델이 Transformers 모델링 백엔드로 마이그레이션됨.
- Rust 프론트엔드 확장: 멀티모달 비디오 및 오디오 지원, Seed-OSS 툴 파서, 네이티브
vllm-bench포팅 완료.
성능 최적화
- DeepSeek-V4 성능 극대화: 전용 라우팅 커널,
fused_topk_bias커널, 중복 복사 제거 등을 통해 E2E TPOT 개선 및 AMD(ROCm) 환경을 위한 2단계 압축기 및 DSpark 투기적 디코딩 최적화 적용. - 생성 모델 정확도 향상:
head_dtype을 통한 fp32lm_head지원(LoRA 경로 및 ROCmtorch.mm패스트 패스 포함)으로 생성 헤드의 정확도 개선.
스토리지 및 오프로딩
- KV 오프로딩 및 계층형 스토리지 고도화: 오프로딩 메트릭, 객체 스토어(Object-store) 기반 2차 계층 스토리지, CPU 오프로딩을 포함한 인코더-캐시(EC) 커넥터 등 계층형 스토리지 관리 기능이 대폭 강화됨.