Qwen1.5-MoE: 활성화 파라미터 1/3만 사용해 7B 모델 성능 구현
·2024.03.28 12:31
Qwen1.5-MoE-A2.7B는 활성화 파라미터를 1/3로 줄이면서도 7B 모델 수준의 성능을 구현했다.
Qwen1.5-MoE-A2.7B는 단 27억 개의 활성화 파라미터만으로 Mistral 7B 및 Qwen1.5-7B와 같은 최첨단 7B 모델과 대등한 성능을 내는 소형 MoE 모델이다.
기존 Qwen1.5-7B와 비교했을 때, 비임베딩 파라미터 수가 약 1/3 수준(20억 개)에 불과하다. 이를 통해 학습 비용을 75% 절감했으며, 추론 속도는 1.74배 향상시켜 자원 효율성을 극대화했다.
모델의 핵심 아키텍처는 다음과 같은 세 가지 혁신을 포함한다:
- Fine-grained experts: 단일 FFN을 여러 세그먼트로 분할하여 기존 8개 전문가 구조보다 8배 많은 총 64개의 전문가를 구성했다.
- Upcycling: 모델을 처음부터 학습시키는 대신 기존 Qwen-1.8B를 재활용하여 초기화함으로써 수렴 속도와 성능을 높였다.
- Routing mechanism: 항상 활성화되는 **4개의 공유 전문가(shared experts)**와 60개의 전문가 중 4개를 선택하는 라우팅 전문가(routing experts) 구조를 결합해 유연성을 확보했다.
MMLU, GSM8K, HumanEval 등 주요 벤치마크에서 Mistral-7B, Gemma-7B 등 상위 7B 모델들과 경쟁할 만한 우수한 성능을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.