AI Briefing

NVIDIA Dynamo, 비전 인코더 분리 서빙 기술 공개

E-P-D 분리 서빙: 비전 인코더를 떼어내 TTFT를 최대 93% 줄이는 조건과 오히려 느려지는 조건 (feat. NVIDIA Dynamo)

·2026.09.11 07:00

핵심 내용

NVIDIA Dynamo가 비전 인코더를 분리해 멀티모달 LLM의 TTFT를 최대 93% 줄이는 서빙 아키텍처를 공개했다.

1 / 12

자세히 보기

NVIDIA가 멀티모달 LLM 서빙 시 비전 인코더(ViT)를 프리필/디코드 프로세스에서 분리해 독립 워커로 실행하는 EPD(Encode-Prefill-Decode) 분리 서빙 기술을 공개했다. 이는 NVIDIA Dynamo 프레임워크를 통해 구현되며, Qwen3.5-122B-A10B 모델을 대상으로 한 벤치마크에서 TTFT(첫 토큰 생성 시간)를 최대 93% 단축하는 효과를 입증했다.

EPD 분리 서빙의 원리와 효과

기존 통합 서빙은 연산 집약적인 프리필과 메모리 집약적인 디코드, 그리고 비전 인코딩이 한 GPU에서 경쟁하며 병목을 유발했다. EPD 아키텍처는 미디어 디코딩과 ViT 순전파를 담당하는 **인코드 워커(E)**와 LLM 추론을 담당하는 PD 워커를 분리한다. 이를 통해 스케줄링 도메인을 분리하고, NIXL을 이용해 임베딩과 KV 블록을 효율적으로 전송한다.

실측 결과, 이미지 10장 입력 및 출력 길이 1024 토큰 조건에서 TTFT는 통합 서빙 대비 50~58% 감소했으며, 동일 SLO 하에서 굿풋(처리량)은 1.70배 향상되었다. 특히 텍스트와 이미지가 혼합된 트래픽(50:50)에서는 헤드 오브 라인 블로킹이 해소되어 텍스트 TTFT가 42.2%, 이미지 TTFT가 30.8% 감소했다.

최적화 조건과 한계

EPD 기술은 모든 워크로드에서 유리하지는 않다. ViT 연산이 TTFT의 **5~11%**를 차지할 때 효과가 가장 크며, 미디어 부하가 높고 출력 길이(OSL)가 짧을수록 이득이 커진다. 반면, 미디어 입력이 적고 출력이 매우 긴 경우(O SL 512 이상)에는 코로케이트 방식이 오히려 종단 간 지연(E2E Latency)이 악화될 수 있다.

NVIDIA는 EPD의 한계를 보완하기 위해 세 가지 최적화 레버를 제시했다:

  • 병렬 미디어 디코딩: Rust 프런트엔드로 디코딩을 이동해 평균 지연을 26% 감소시킴.
  • 임베딩 캐시: CPU LRU 캐시를 활용해 반복 미디어 워크로드의 지연을 줄임.
  • 멀티모달 KV 라우팅: 콘텐츠 해싱을 통해 KV 블록 재사용률을 높임.

이 기술은 vLLM 0.26.0 및 SGLang 0.5.16 환경에서 재현 가능하며, 관련 스크립트와 벤치마크 코드는 Apache 2.0 라이선스로 공개되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.