MiniMax, 새로운 sparse attention 메커니즘과 15.6배 빠른 long-context 응답 속도를 갖춘 M3 모델 공개 예고
·2026.05.29 09:00
MiniMax가 새로운 sparse attention 메커니즘을 도입해 long-context 응답 속도를 15.6배 높인 M3 모델을 예고했다.
중국의 AI 기업 MiniMax가 자사의 인기 모델인 M2 시리즈의 기술 보고서를 공개하며, 차세대 M3 모델의 핵심 기술을 예고했다. M2 시리즈는 MoE(Mixture-of-Experts) 구조를 통해 2,299억 개의 파라미터를 보유하면서도, 토큰당 98억 개의 파라미터만 활성화하여 효율적인 운영을 구현했다.
M2 모델은 모든 62개 레이어에 **GQA(Grouped Query Attention)**를 적용한 풀 멀티 헤드 어텐션 방식을 채택했다. 이는 정밀한 문맥 파악을 가능하게 하지만, 입력 길이가 길어질수록 연산량이 기하급수적으로 증가하는 'quadratic scaling' 문제를 야기한다.
이에 대응하기 위해 MiniMax는 차세대 M3 모델에서 새로운 sparse attention 접근 방식을 도입한다. 커스텀 sub-quadratic framework를 채택한 M3는 다음과 같은 성능 향상을 목표로 한다:
- 15.6배 빠른 디코딩 속도: 100만 토큰의 long-context 환경에서 응답 속도를 획기적으로 개선한다.
- 경제적 AI 에이전트 배포: 초장문 문맥 처리에 필요한 하드웨어 비용을 낮춰 AI 에이전트 활용의 경제성을 확보한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.