SpecMD: MoE expert 사전 적재와 캐싱에 대한 종합 연구
·2026.05.06 09:00
핵심 내용
SpecMD가 MoE expert 캐시 정책을 벤치마크해 Least-Stale를 제안했다.
자세히 보기
Mixture-of-Experts(MoE) 모델은 sparse expert activation 덕분에 추론마다 일부 expert만 쓰지만, 실제 성능을 내려면 expert caching과 사전 적재가 필요하다. 기존 캐시 정책은 하드웨어별 차이와 정책 간 상호작용을 충분히 설명하지 못했다.
SpecMD는 다양한 하드웨어 구성에서 ad-hoc cache policy를 표준화해 비교하는 벤치마크 프레임워크다. 통제된 조건과 현실적인 제약 아래 기존 MoE caching 전략을 재현·확장해, 정책별 성능을 일관되게 측정한다.
핵심 실험 결과는 다음과 같다.
- MoE expert 접근은 LRU와 LFU가 가정하는 temporal locality와 잘 맞지 않았다.
- 이를 바탕으로 Least-Stale를 제안했고, 충돌 미스(collision miss)를 LRU 대비 최대 85배 줄였다.
- OLMoE에서는 VRAM 캐시 5% 또는 0.6GB만으로 88% 이상 hit rate와 최대 34.7% TTFT(Time-to-first-token) 감소를 달성했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.