MoE 서빙 지연시간을 줄이는 ELDR 라우팅 기술
ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving
·2026.07.03 23:19
핵심 내용
MoE 모델의 전문가 지역성을 고려한 ELDR 라우팅을 통해 디코드 지연시간을 최대 13.9% 단축함.
자세히 보기
Prefill-Decode(PD) 분리형 LLM 서빙 환경에서 MoE(Mixture-of-Experts) 모델의 효율적인 추론을 위한 ELDR(Expert-Locality-Aware Decode Router) 기술이 제안되었습니다.
기존의 디코드 라우터는 단순히 워커(Worker)의 부하 균형만을 고려하지만, MoE 모델은 각 디코드 단계에서 활성화되는 전문가(Expert)의 가중치 로드 여부에 따라 지연시간이 달라지는 특성이 있습니다. ELDR는 다음과 같은 메커니즘을 통해 이를 해결합니다.
- Expert Signature: 요청의 Prefill 단계에서 발생하는 전문가 활성화 패턴을 기반으로, 생성 과정에서 활성화될 전문가를 예측하는 시그니처를 생성합니다.
- Locality-Band Routing: 오프라인에서 K-means 클러스터링으로 분할된 시그니처 공간을 바탕, 요청을 해당 전문가를 보유한 워커 중 부하가 가장 적은 곳으로 할당합니다.
- Signature Cache: KV 캐시와 연동된 시그니처 캐시를 통해 Prefix Caching 환경에서도 정확한 라우팅을 유지합니다.
vLLM에 구현되어 40개의 GPU 규모에서 테스트한 결과, 기존의 최신 부하 분산 베이스라인 대비 중앙값 TPOT(Time Per Output Token)를 5.9%에서 13.9%까지 감소시키는 성능 향상을 보였습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.