Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화: 콜드 스타트 428초→226초
핵심 내용
Amazon EKS에서 vLLM으로 Gemma 4 서빙 시 Run:ai 스트리머와 캐시 최적화로 콜드 스타트를 428초에서 226초로 단축했다.
자세히 보기
Amazon EKS 환경에서 Gemma 4 모델 서빙 시 발생하는 긴 콜드 스타트 문제를 해결하기 위한 최적화 사례를 소개한다. 기본 설정에서 콜드 스타트는 428초가 소요되며, 주요 병목은 S3 가중치 로드와 torch.compile 캐시 소멸이었다.
가중치 로드 및 컴파일 캐시 최적화
Run:ai Model Streamer를 적용해 FUSE 병목을 해결하고 병렬 range read로 가중치 로드 시간을 127.6초에서 19.8초로 6.5배 단축했다. 또한 hostPath를 활용해 torch.compile 캐시를 영속화하고, S3에 컴파일 캐시를 게시해 신규 노드에서도 컴파일 시간을 6.6초 수준으로 유지했다.
이미지 풀링 및 Sleep Mode 활용
EC2NodeClass userData를 통해 이미지를 사전 pull해 풀링 시간을 절반으로 줄였다. 간헐적 수요 대응을 위해 vLLM sleep mode를 적용하면 GPU 메모리를 CPU RAM으로 이동시켜 0.97초 만에 추론 상태로 복귀할 수 있다. 이는 웜 재시작 대비 약 137배 빠른 속도다.
최종 성능 및 운영 전략
최종적으로 콜드 스타트는 428초에서 226초(-47%), 웜 재시작은 314초에서 133초(-58%)로 개선됐다. 잦은 재시작에는 스트리밍과 hostPath를, Spot 인스턴스 교체 시에는 S3 캐시와 이미지 사전 pull을, 간헐적 수요에는 sleep/wake를 조합해 운영 비용을 최소화할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.