AI Briefing

Mixture-of-Experts 모델에서 드러나는 모듈성

·2026.05.11 09:00

Ai2가 EMO를 공개해 MoE의 일부 전문가만으로도 성능을 거의 유지할 수 있음을 보였다.

Ai2EMO를 공개했다. 이 Mixture-of-Experts(MoE) 모델은 1B-active, 14B-total 규모이며, 8개 활성 전문가128개 총 전문가를 가진다. 1조 토큰으로 학습했고, 전체 전문가를 함께 쓸 때는 강한 범용 성능을 유지하면서도 일부 전문가만 골라 써도 성능이 크게 무너지지 않도록 설계됐다.

핵심은 문서 경계를 약한 감독 신호로 쓰는 방식이다. 같은 문서의 토큰들은 하나의 공유 전문가 풀 안에서만 라우팅되고, 라우터가 문서 전체의 선호를 평균 내 가장 많이 쓰인 전문가 묶음을 선택한다. 그 결과 전문가들은 전치사나 구두점 같은 표면 패턴보다 의료, 뉴스, 정치, 영화처럼 의미 기반 영역으로 묶이기 쉬워진다.

학습 안정성을 위해 global load balancing을 문서가 아니라 더 큰 범위에서 적용했고, 문서 풀 크기는 고정하지 않고 무작위로 샘플링했다. 로컬 마이크로배치에서 load balancing을 걸면 같은 문서 안의 토큰이 여러 전문가로 퍼져 EMO의 목표와 충돌하지만, 전역적으로 균형을 맞추면 문서 내부 일관성과 전체 전문가 활용을 함께 잡을 수 있다.

벤치마크에서는 전체 전문가를 쓸 때 표준 MoE와 비슷한 성능을 냈고, 전문가 일부만 남긴 조건에서도 견고했다.

  • **25% 전문가(32개)**만 유지해도 전체 평균 성능 하락은 약 1%p였다.
  • **12.5% 전문가(16개)**만 남겨도 하락은 약 3%p 수준이었다.
  • 이 결과는 사전학습 뒤와 fine-tuning 뒤 모두에서 유지됐다.

전문가 선택도 싸다. few-shot 데모가 포함된 단일 예시만으로도 전체 validation set으로 고른 모듈에 맞먹는 성능을 내는 전문가 묶음을 찾을 수 있었고, Easy-EP 같은 기존 expert-pruning 방식과도 잘 결합됐다.

라우터 활성화를 1만2000개 pretraining 문서의 앞 100개 토큰 기준으로 클러스터링해 보니, EMO는 Health, Medical & Wellness, News Reporting, US Politics & Elections, Film & Music 같은 의미 기반 군집을 만들었다. 반면 표준 MoE는 Prepositions, Proper Names, Copula Verbs, Definite Articles처럼 표면적 토큰 패턴에 더 끌렸다.

Ai2는 EMO 본모델, 같은 데이터로 학습한 표준 MoE 베이스라인, 학습 코드를 함께 공개했다. 작은 expert subset을 선택하고 조합해도 작동하는 modular language model을 향한 초기 단계라는 점을 강조했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.