AI Briefing

vLLM-Omni, 멀티모달 통합 서빙 출시

Quick look at vLLM-Omni: Unified serving for Audio, Video, DiTs, and Vision

·2026.10.09 11:58

핵심 내용

vLLM-Omni가 DiTs까지 PagedAttention을 확장해 Qwen3-Omni 등 멀티모달 서빙을 통합했다.

자세히 보기

vLLM-Omni는 텍스트, 오디오, 디퓨전, 비전 모델을 하나의 추론 프레임워크로 통합해 멀티모달 AI 서빙의 분절 문제를 해결한다. 기존에는 이러한 혼합 워크로드를 처리하기 위해 여러 프레임워크를 별도 포트나 컨테이너에서 관리해야 했다.

핵심 아키텍처

이 시스템은 표준 vLLM 엔진의 PagedAttention과 KV 캐시 최적화를 Diffusion Transformers(DiTs) 및 병렬 생성 모델로 확장한다. GPU 간 데이터를 전달하는 분리형 파이프라인 OmniConnector를 활용해 실시간 전이중(full-duplex) 오디오, 비디오, 이미지 생성을 지원한다.

지원 모델

현재 다음 멀티모달 및 로보틱스 모델을 지원한다:

  • Qwen3-Omni
  • MiniCPM-o 4.5
  • MiniMax H3
  • Wan2.2
  • Qwen3-TTS
  • $\pi_0$.5 등 로보틱스 액션 모델

OpenAI 호환 API를 제공하며 GitHub와 기술 보고서를 통해 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.