AI Briefing

MoE 서빙 지연시간을 줄이는 ELDR 라우팅 기술

ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving

·2026.07.03 23:19

MoE 모델의 전문가 지역성을 고려한 ELDR 라우팅을 통해 디코드 지연시간을 최대 13.9% 단축함.

Prefill-Decode(PD) 분리형 LLM 서빙 환경에서 MoE(Mixture-of-Experts) 모델의 효율적인 추론을 위한 ELDR(Expert-Locality-Aware Decode Router) 기술이 제안되었습니다.

기존의 디코드 라우터는 단순히 워커(Worker)의 부하 균형만을 고려하지만, MoE 모델은 각 디코드 단계에서 활성화되는 전문가(Expert)의 가중치 로드 여부에 따라 지연시간이 달라지는 특성이 있습니다. ELDR는 다음과 같은 메커니즘을 통해 이를 해결합니다.

  • Expert Signature: 요청의 Prefill 단계에서 발생하는 전문가 활성화 패턴을 기반으로, 생성 과정에서 활성화될 전문가를 예측하는 시그니처를 생성합니다.
  • Locality-Band Routing: 오프라인에서 K-means 클러스터링으로 분할된 시그니처 공간을 바탕, 요청을 해당 전문가를 보유한 워커 중 부하가 가장 적은 곳으로 할당합니다.
  • Signature Cache: KV 캐시와 연동된 시그니처 캐시를 통해 Prefix Caching 환경에서도 정확한 라우팅을 유지합니다.

vLLM에 구현되어 40개의 GPU 규모에서 테스트한 결과, 기존의 최신 부하 분산 베이스라인 대비 중앙값 TPOT(Time Per Output Token)를 5.9%에서 13.9%까지 감소시키는 성능 향상을 보였습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.