MoE(Mixture of Experts) 핵심 정리
Mixture of Experts Explained
·2023.12.11 09:00
MoE 아키텍처의 작동 원리, 학습 방법, 그리고 추론 시의 트레이드오프를 상세히 설명한다.
**Mixture of Experts(MoE)**는 모델의 파라미터 규모를 효율적으로 확장하기 위한 아키텍처로, 최근 Mixtral 8x7B 등의 등장으로 큰 주목을 받고 있다.
핵심 구성 요소
- Sparse MoE 레이어: 기존의 밀집(Dense) FFN 레이어를 여러 개의 전문가(Expert) 네트워크로 대체한다.
- 게이트 네트워크(Router): 각 토큰을 적절한 전문가에게 전달하는 역할을 하며, 학습 과정에서 함께 최적화된다.
주요 장점
- 학습 효율성: 동일한 컴퓨팅 자원으로 밀집 모델보다 훨씬 큰 규모의 모델을 빠르게 사전 학습할 수 있다.
- 추론 속도: 동일한 파라미터 수를 가진 밀집 모델 대비 추론 속도가 빠르다.
주요 과제 및 고려사항
- 메모리 사용량: 모든 전문가를 메모리에 올려야 하므로 높은 VRAM이 요구된다.
- 학습 안정성: 특정 전문가에게 토큰이 쏠리는 현상을 막기 위한 **로드 밸런싱(Load Balancing)**과 Router Z-loss 기술이 중요하다.
- 미세 조정(Fine-tuning): 밀집 모델에 비해 미세 조정이 까다롭지만, 최근 지시어 튜닝(Instruction-tuning) 연구를 통해 개선되고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.