NVIDIA Dynamo 기반의 Pinterest VLM 서빙 스택 구축
핵심 내용
Pinterest가 NVIDIA Dynamo와 Blackwell GPU를 활용해 VLM 서빙 스택을 구축하고 TTFT를 85배 개선했다.
자세히 보기
Pinterest는 NVIDIA Dynamo와 Blackwell GPU를 기반으로 대규모 비전 언어 모델(VLM) 서빙 스택을 구축했다. 이 인프라는 Pinterest Assistant, 하이브리드 검색, 멀티모달 리랭킹 등 다양한 AI 서비스에 적용되며, Qwen3-VL 모델에 자체 개발한 PinCLIP 임베딩을 결합해 성능과 비용을 최적화했다.
VLM 서빙의 과제와 아키텍처
VLM 워크로드는 이미지 처리로 인한 높은 Prefill 비용과 긴 대화 히스토리에서 발생하는 KV Cache 압력이 주요 병목이다. Pinterest는 이를 해결하기 위해 Encoder/Prefill/Decode(E/P/D) 분리 서빙 아키텍처를 채택했다. Dynamo의 Rust 기반 라우터와 LMCache를 활용해 GPU, CPU DRAM, NVMe 간 다중 계층 KV Cache 오프로딩을 구현했으며, 이를 통해 VRAM 압력을 관리하고 지연 시간을 단축했다.
Projection Embeddings를 통한 성능 향상
기존 픽셀 기반 입력 대신 사전 계산된 PinCLIP Projection Embeddings를 사용함으로써 비전 인코더 연산 비용을 대폭 절감했다. 이 방식은 평균 TTFT(Time To First Token)를 85배, 엔드투엔드 지연 시간을 7.3배 개선하는 성과를 거뒀다. 또한 250개의 임베딩을 처리할 때 픽셀 이미지 10개 수준의 지연으로 25배 더 많은 시각적 컨텍스트를 처리할 수 있게 되었다.
확장성과 운영 효율화
Dynamo의 LoRA Hot Loading 기능을 통해 별도의 전체 배포 없이 베이스 모델에 여러 LoRA 가중치를 동적으로 로드할 수 있어 GPU 사용량과 운영 오버헤드를 줄였다. NVIDIA AIPerf를 활용한 DAG 벤치마킹으로 실제 프로덕션 환경의 멀티턴 대화와 에이전틱 워크플로우를 시뮬레이션하며, Dynamo Planner를 통해 프리필/디코드 레플리카 수를 동적으로 조정해 SLA를 충족시킨다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.