AI Briefing

MoE 모델의 라우팅 전문가 28% 제거해도 성능 유지

[Research] MoE routing tail redundancy: dropping 28% of routed experts leaves GSM8K accuracy unchanged

·2026.07.25 21:35

MoE 모델에서 가중치가 낮은 라우팅 전문가를 일부 제거해도 추론 성능에 영향이 없음을 확인했다.

Mixture-of-Experts(MoE) 모델의 추론 시 라우팅 테일(Routing Tail) 중복성을 테스트한 결과, 가중치가 낮은 전문가를 제거해도 성능 저하가 거의 없음을 발견했다.

핵심 실험 내용:

  • 대상 모델: 35B MoE (top-k=8, total experts=256)
  • 방법론: 고정된 k값을 줄이는 대신, 라우터가 부여한 가중치가 특정 임계값(1/k)보다 낮은 전문가를 건너뛰는 per-token thresholding 방식 적용
  • 결과: 라우팅된 전문가의 약 28%를 제거했음에도 GSM8K 벤치마크 성능이 기존(12/15)과 동일하거나 미세하게 개선(13/15)된 수준을 유지함

주요 시사점:

  • MoE 모델의 라우터는 특정 전문가에 가중치를 집중시키며, 하위 가중치 전문가들은 출력에 기여하는 바가 매우 적은 **중복성(Redundancy)**을 가짐
  • 이 연구는 추론 시 연산 효율을 높이기 위해 가중치가 낮은 전문가를 동적으로 스킵할 수 있는 가능성을 제시함
  • 다만, 실험 샘플 수가 적어(n=15) 더 광범위한 벤치마크와 대규모 검증이 필요함

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.