AI Briefing

vLLM v0.28.0 릴리스: Kimi-K3 및 DeepSeek V4 최적화, 추론 성능 대폭 향상

·2026.08.30 03:22

핵심 내용

vLLM v0.28.0이 Kimi-K3와 DeepSeek V4를 위한 대규모 성능 최적화 및 새로운 추론 기능을 공개했다.

자세히 보기

vLLM v0.28.0 릴리스는 270명의 기여자가 참여한 584개 커밋을 포함하며, 주요 LLM 모델에 대한 성능 최적화와 인프라 개선에 초점을 맞췄다.

Kimi-K3 및 DeepSeek V4 최적화

Kimi-K3를 위한 스택 전반의 최적화 작업이 이루어졌다. Decode Context Parallel(DCP) 지원, FlashKDA 디코드 및 프리필 커널 융합, MegaMoE를 위한 SiTU 활성화 지원 등이 포함된다. 또한 적응형 추측 디코딩 토큰 예산을 통해 DSpark TTFT(Time to First Token)를 약 60% 개선하고, 공유 전문가 샤딩을 통해 GPU당 약 17 GiB의 메모리를 절약할 수 있다. DeepSeek V4의 경우 희소 MLA(Sparse MLA)가 일반 디코드, MTP, DSpark 추측 디코딩에서 엔드투엔드로 작동하도록 지원하며, AMD Quark NVFP4 지원 및 ROCm 호환성도 강화됐다.

추론 및 모델 러너 개선

추측 디코딩 기술이 진화하여 DFlash2(로컬 컨볼루션 및 후보 선택기 포함)와 DSpark 신뢰도 기반 검증이 도입됐다. Model Runner V2는 E/P 디스어그리게이션, 가중치 오프로딩, 다층 MTP KV 캐시 지원 등을 통해 성숙 단계에 접어들었다. 또한 계층적 KV 캐시 오프로딩을 위해 디스크 오프로딩 지원과 병렬성 독립적 오프로딩을 위한 표준 CPU 레이아웃이 추가됐다.

기본 설정 변경 및 기타

기본 max_num_batched_tokens가 8192에서 16384로 상향 조정됐으며, Mamba 모델에 대해 프리픽스 캐싱이 기본적으로 활성화됐다. Rust 프론트엔드와 gRPC 관련 기능도 확장되어 독립 렌더러, 멀티모달 이미지 추론 지원, 명시적 데이터 병렬 랭크 라우팅 등이 포함됐다. bitsandbytes 지원은 외부 플러그인으로 이전되는 등 일부 호환성 변경 사항도 존재한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.