AI Briefing

Mixture of Experts(MoE)란 무엇인가 — DeepSeek이 왜 1.6조 파라미터인데도 싸게 돌아가는지

·2026.04.27 13:20

MoE 아키텍처가 DeepSeek의 대규모 모델 추론 비용을 낮추는 이유를 설명했다.

**Mixture of Experts(MoE)**는 여러 expert 서브모델과 이를 선택하는 **router(gating network)**로 구성된다.

  • 토큰마다 모든 파라미터를 쓰는 dense model과 달리, MoE는 라우터가 필요한 전문가 몇 개만 활성화한다.
  • 그 결과 전체 파라미터는 매우 크더라도 실제 계산량은 훨씬 작게 유지된다.

DeepSeek V4-Pro 기준으로는 전체 1.6조 파라미터 중 토큰당 **490억(약 3%)**만 활성화된다고 정리했다.

  • 이 구조 덕분에 1.6조 규모의 지식을 담으면서도 추론 비용은 490억 규모 모델에 가까워진다.
  • 일반적으로 MoE는 같은 규모의 dense model 대비 가격 대비 성능을 3~5배 개선하는 것으로 소개된다.

다만 제약도 있다.

  • 모든 expert 파라미터를 메모리에 올려야 해서 VRAM 요구량이 크다.
  • 학습 중 특정 expert에 부하가 몰리는 불균형 문제를 별도로 관리해야 한다.

결론적으로, 주요 프론티어 모델들이 MoE를 채택하면서 AI 모델 경쟁의 기준이 단순한 크기보다 비용 대비 성능으로 이동하고 있다고 설명한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.