학습 중 MoE 확장
Expert Upcycling: Growing MoE capacity mid-training without increasing inference cost (7B→13B, ~32% GPU hours saved)
·2026.04.24 07:53
32개 expert MoE를 학습 도중 64개로 늘려 GPU 시간을 약 32% 줄였다.
32개 expert로 학습한 MoE를 중간에 64개 expert로 늘리는 expert upcycling을 제안했다.
기존 expert를 복제한 뒤 router에 작은 bias noise를 넣어 대칭을 깨고, 계속 pre-training하면서 replica가 각각 특화되도록 했다. Top-K routing은 고정해 token당 FLOPs와 추론 비용은 그대로 유지했고, loss-free load balancing으로 모든 replica가 gradient를 받도록 해 routing collapse를 막았다.
성과는 다음과 같다.
- 7B→13B interleaved MoE(32→64 experts, Top-2, Llama 4 유사)에서 validation loss 1.263 vs 1.267.
- 11개 downstream benchmark 평균 정확도 56.4 vs 56.7.
- 64-expert 모델을 처음부터 학습하는 것보다 GPU hours 약 32% 절감.
- 32-expert checkpoint가 이미 있는 sunk-cost 상황에서는 약 67% 절감.
또한 256 expert Top-8 full MoE에서도 검증해, DeepSeek-V3, Kimi K2, GLM-4.5 계열 구성까지 일반화됨을 보였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.