vLLM-Omni, 멀티모달 통합 서빙 구조 공개
vLLM-Omni 기술 보고서: 음성, 이미지, 영상, 로봇 행동 모델을 한 런타임에서 서빙하는 구조
핵심 내용
텍스트부터 로봇 행동까지 79개 모델 행을 단일 런타임에서 서빙하는 아키텍처와 성능 데이터 공개
자세히 보기
vLLM-Omni 기술 보고서(arXiv:2610.09307)가 공개되어 텍스트, 음성, 이미지, 영상, 로봇 행동을 하나의 런타임에서 서빙하는 구조를 설명했습니다. Apache-2.0 라이선스로 GitHub에 코드가 공개되었으며, 오케스트레이터가 요청 수락과 스테이지 진행을 담당하고 실행 엔진이 모델 구성 요소를 처리하는 계층적 구조를 채택했습니다.
핵심 아키텍처 및 성능
오케스트레이터는 요청 라우팅과 세션 관리를, 실행 엔진은 토큰 스케줄링과 디노이징을 담당합니다. 특히 async_chunk 메커니즘은 앞 스테이지가 청크를 생성하는 즉시 다음 스테이지로 전달하여 **TTFP(첫 오디오 패킷까지 시간)**를 감소시킵니다. H100 환경에서 Qwen3-Omni를 테스트한 결과, 동시성 32일 때 async_chunk을 비활성화하면 TTFT가 6.7배 증가하고 RTF가 실시간 한계(1.0)에 근접하는 0.93으로 악화되었습니다.
H200 환경에서 MRv2 프로필을 적용하면 동시성 16 이상에서 기본 배포 대비 E2EL과 RTF가 대략 절반으로 감소하며, 동시성 32에서 TTFP도 1,064.6ms에서 500.4ms로 개선됩니다. 다만 MRv2는 일부 시작 단계 실패 이슈가 보고되어 방어 코드가 필요합니다.
지원 모델 및 생태계
현재 79개의 모델 행을 지원하며, AR 옴니(Qwen3-Omni), 전이중 음성(PersonaPlex), TTS(CosyVoice3), 이미지 생성(FLUX), 영상 생성(Wan2.1), 월드 모델(Cosmos3), VLA(GR00T N1.7) 등을 포함합니다. OpenAI 호환 API와 로봇용 OpenPI 프로토콜을 노출하여 기존 서빙 환경과의 호환성을 확보했습니다.
한계 및 주의사항
외부 프레임워크(SGLang-Omni 등)와의 직접 비교는 이번 판에서 제외되었습니다. 일부 옵트인 프로필은 안정성이 불균일하며, 텍스트 전용 요청 경로에서는 vLLM-Omni가 thinker 전용 vLLM 대비 TTFT가 약 53% 높게 나타나 오버헤드가 존재합니다. 현재 NVIDIA GPU(H100/H200) 환경에서만 측정되었으며, ROCm/Ascend 등 다른 하드웨어 지원은 향후 과제입니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.