AI Briefing

Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]

·2026.09.10 09:35

핵심 내용

NVFP4 정밀도와 대화형/배치 풀 분리를 통해 Gemma 4의 SLO 준수 처리량을 극대화하는 vLLM 최적화 전략을 소개한다.

1 / 3

자세히 보기

정밀도 비교와 SLO 준수

NVFP4는 BF16 대비 최대 처리량 1.86배, SLO 준수 하에서 6.3배의 성능 향상을 보인다. BF16과 FP8은 동시성 1에서 이미 SLO를 초과하지만, NVFP4는 동시성 4까지 TTFT p99 500ms와 ITL p99 50ms를 만족한다. 동시성 32에서는 연산 병목으로 FP4 텐서코어 활용 효과가 나타나 FP8 대비 1.20배의 차이를 보인다.

Speculative Decoding과 풀 분리

**Speculative Decoding(MTP n=4)**은 처리량을 최대 2.13배 높이지만, ITL p99를 4배 이상 악화시켜 대화형 SLO를 위반한다. 따라서 대화형 트래픽과 배치성 트래픽을 풀로 분리하는 것이 필수적이다. 대화형 풀은 MTP를 비활성화하고, 배치 풀은 MTP와 낮은 우선순위를 적용한다.

Prefix Caching과 튜닝

Prefix Caching은 프롬프트 공유율이 높을 때 처리량을 40.5% 상승시키고 TTFT를 2.1배 단축한다. 적중률에 따라 GPU당 처리량이 10배까지 차이 나므로, 프롬프트 구조 최적화가 중요하다. 텍스트 전용 풀에서는 이미지 인코더 예약을 해제해 KV 캐시 용량을 12.6% 늘릴 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.