[CVPR 2026] MoE 구조 내에서 진정한 전문가를 생성하기 위한 업사이클링 방법 - LG AI Research BLOG
·2026.07.16 09:00
LG AI Research가 기존 Dense 모델을 MoE로 변환할 때 전문가 간 중복 문제를 해결하는 'Cluster-Aware Upcycling' 기술을 제안했다.
AI 모델의 성능을 높이기 위해 모델 크기를 키우는 방식은 막대한 연산 비용을 초래한다. 이를 해결하기 위해 필요한 부분만 활성화하는 Mixture-of-Experts (MoE) 구조가 주목받고 있지만, 기존의 Sparse Upcycling 방식은 사전 학습된 Dense 모델의 파라미터를 그대로 복사하기 때문에 전문가들이 서로 유사한 기능만 수행하는 '전문가 대칭성(Expert Symmetry)' 문제가 발생한다.
LG AI Research는 이를 해결하기 위해 Cluster-Aware Upcycling 기술을 제안했다. 이 방식은 이미 잘 학습된 Dense 모델의 활성화 값(Activation)에 데이터의 의미적 구조가 담겨 있다는 점에 착안한다.
핵심 프로세스는 다음과 같다:
- FFN 활성화 값 클러스터링: 사전 학습된 모델의 FFN 블록에 입력되는 활성화 값을 추출한 뒤, Spherical k-means를 사용하여 의미적으로 유사한 데이터 영역을 클러스터링한다.
- 전문가별 특화 초기화: 클러스터링된 결과에 따라 각 전문가(Expert)가 서로 다른 데이터 영역을 담당하도록 초기값을 다르게 설정한다.
이 기술을 통해 모델은 초기 단계부터 각 전문가가 고유한 영역을 학습하도록 유도되어, 기존 방식보다 훨씬 효율적이고 강력한 전문성을 확보할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.