[CVPR 2026] Mixture-of-Experts 구조 내에서 진정한 의미의 Expert를 만드는 Upcycling 방법
·2026.07.16 09:00
LG AI연구원이 Dense 모델을 MoE로 변환할 때 전문가의 중복성을 줄이고 전문성을 극대화하는 Cluster-Aware Upcycling 기술을 공개했다.
기존의 Sparse Upcycling 방식은 Dense 모델의 FFN을 여러 Expert로 복사하여 초기화하기 때문에, 모든 Expert가 유사한 파라미터를 갖게 되어 전문성이 떨어지는 Expert Symmetry 문제가 발생한다. 이는 모델의 효율성을 저해하는 주요 원인이 된다.
LG AI연구원은 이를 해결하기 위해 Cluster-Aware Upcycling 기법을 제안했다. 이 방식은 Dense 모델의 Activation Space에 담긴 데이터의 의미 구조를 활용하여 Expert를 차별화한다.
핵심 프로세스는 다음과 같다:
- Step 1: FFN Activation을 Spherical K-Means로 클러스터링하여 데이터의 의미적 영역을 구분한다.
- Step 2: Data-Aware Truncated SVD를 사용하여 각 Expert가 특정 클러스터의 주요 성분을 담당하도록 초기화한다.
- Step 3: 클러스터의 Centroid를 Router Weight로 사용하여 초기 학습 단계부터 데이터가 적절한 Expert로 배정되도록 유도한다.
또한, 학습 중 Routing이 불확실한 토큰으로 인해 전문성이 저해되는 것을 막기 위해, Ensemble Teacher를 활용한 EESD 손실 함수를 도입하여 안정적인 학습을 지원한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.