vLLM, AMD GPU 환경에서 5가지 Speculative Decoding 방식 성능 벤치마크 공개
·2026.09.07 18:26
핵심 내용
vLLM이 AMD MI300X/MI355X GPU에서 Native MTP, EAGLE-3, DFlash 등 5가지 추측 디코딩 방식의 처리량과 최적 설정을 비교한 상세 벤치마크 결과를 공개했다.
자세히 보기
vLLM이 AMD Instinct MI300X 및 MI355X GPU와 ROCm 플랫폼 환경에서 Speculative Decoding의 5가지 주요 방식(Native MTP, Gemma 4 MTP, EAGLE-3, DFlash, DSpark)을 비교한 기술 가이드와 벤치마크 데이터를 공개했다. 이 문서는 각 방식의 작동 원리, vLLM 설정 방법, 그리고 실제 서빙 환경에서의 처리량(Throughput) 및 가속비(Speedup)를 상세히 다룬다.
주요 방식 및 작동 원리
- Native MTP: 타겟 모델 아키텍처에 내장된 보조 예측 경로를 사용하며, 별도 체크포인트 없이 순차적으로 후보 토큰을 생성한다.
- Gemma 4 MTP: 타겟 모델과 페어링된 별도 체크포인트를 사용하며, 타겟 모델의 Activation과 KV Cache를 공유한다.
- EAGLE-3: 타겟 모델의 Hidden States를 기반으로 Autoregressive 방식으로 Drafting을 수행하는 전용 네트워크를 사용한다.
- DFlash: 타겟 모델의 Hidden States를 조건으로 병렬 블록 단위로 후보 토큰을 예측하여 Drafting 지연을 줄인다.
- DSpark: DFlash의 병렬 백본에 경량 Sequential Head와 Confidence 기반 Prefix 선택 메커니즘을 추가하여 정합성을 높였다.
성능 벤치마크 결과
실험은 Gemma, Qwen, Kimi, MiniMax 등 다양한 모델 패밀리와 GSM8K, MATH500, HumanEval, MBPP 벤치마크를 대상으로 수행되었다.
- 최대 가속비: 일부 설정에서 Non-speculative Baseline 대비 2배 이상의 처리량 향상을 달성했다. 예를 들어,
gemma-4-26B-A4B-it모델에서 DFlash 방식은 MATH500 벤치마크에서 2.87배, Gemma 4 MTP는 GSM8K에서 2.74배의 가속비를 기록했다. - 모델별 특성: Qwen3.5-122B-A10B 모델의 Native MTP는 MATH500에서 2.20배의 가속비를 보였으며, Kimi-K2.5 모델에서 DFlash는 MATH500 기준 2.68배의 성능 향상을 보였다.
- 작은 모델의 한계: Qwen3-8B와 같은 작은 모델에서는 Drafting 오버헤드로 인해 일부 벤치마크(MATH500 등)에서 Baseline 대비 성능이 저하되거나 미미한 향상만 나타나기도 했다.
튜닝 및 배포 고려사항
Speculative Decoding은 고정된 설정이 아닌 런타임 최적화 대상이다. num_speculative_tokens(제안 길이)는 모델과 워크로드에 따라 최적값이 다르며, 과도한 값은 Drafting 비용 증가로 이어져 처리량을 감소시킬 수 있다.
- 권장 튜닝 워크플로우: 체크포인트 권장 설정으로 시작하여, 대표 프롬프트로 Benchmark를 수행하고 Throughput, Mean Accepted Length, Acceptance Rate를 모니터링하며 최적의
num_speculative_tokens를 찾아야 한다. - 모니터링 지표: 후반부 Draft Position의 Acceptance Rate가 낮다면 제안 길이를 줄여 불필요한 Drafting 작업을 피하는 것이 유리하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.