MoBA: MoE 기반 블록 어텐션 공개
MoBA: 어텐션에 전문가 혼합을 적용해 긴 문맥을 효율적으로 처리하는 블록 어텐션 (feat. MoonshotAI)
·2026.07.21 08:30
MoE 원리를 어텐션에 적용하여 긴 문맥 처리 효율을 극대화한 MoBA 기술이 발표되었습니다.
Moonshot AI와 칭화대학교 연구진이 발표한 **MoBA(Mixture of Block Attention)**는 긴 문맥(Long-context) 처리 시 발생하는 어텐션 연산 비용 문제를 해결하기 위한 새로운 기법입니다.
기존의 슬라이딩 윈도우나 선형 어텐션 방식과 달리, MoBA는 전체 문맥을 여러 **블록(Block)**으로 나누고, 각 쿼리 토큰이 가장 관련 있는 블록을 스스로 선택하도록 설계되었습니다. 이 과정에서 **Mixture of Experts(MoE)**의 top-k 게이팅 메커니즘을 활용하여 연산의 희소성(Sparsity)을 확보합니다.
주요 성과 및 특징:
- 높은 효율성: 100만 토큰 프리필(prefill) 시 전체 어텐션 대비 최대 6.5배, 1000만 토큰에서는 최대 16배 빠른 속도를 기록했습니다.
- 성능 유지: 연산량은 획기적으로 줄이면서도 다양한 벤치마크에서 전체 어텐션과 거의 동일한 성능을 유지합니다.
- 실서비스 적용: 이미 Moonshot AI의 Kimi 모델에 적용되어 긴 문맥 요청을 처리하는 데 사용되고 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.