MiniMax, 초장기 문맥 처리를 위한 MSA 공개
MiniMax Sparse Attention (MSA)
·2026.06.12 23:55
MiniMax가 대규모 문맥 처리를 위해 연산 효율을 극대화한 새로운 희소 어텐션 기술인 MSA를 발표했습니다.
MiniMax는 초장기 문맥(Ultra-long-context) 처리를 위한 새로운 어텐션 메커니즘인 **MiniMax Sparse Attention (MSA)**를 공개했습니다. MSA는 Grouped Query Attention(GQA)을 기반으로 한 블록 단위 희소 어텐션 기술입니다.
핵심 기술 특징:
- Index Branch: KV 블록의 점수를 매겨 각 GQA 그룹에 대해 최적의 Top-k 서브셋을 독립적으로 선택합니다.
- Main Branch: 선택된 블록들에 대해서만 정밀한 블록 희소 어텐션을 수행합니다.
- GPU 최적화: exp-free Top-k 선택과 KV-outer sparse attention을 통해 Tensor Core 활용도를 높인 전용 커널을 함께 설계했습니다.
성능 지표 (109B 모델 기준):
- 1M 토큰 문맥에서 GQA와 대등한 성능을 유지하면서도 토큰당 어텐션 연산량을 28.4배 절감했습니다.
- H800 GPU 환경에서 MSA 적용 시, Prefill 속도는 14.2배, Decoding 속도는 7.6배 향상된 Wall-clock 성능을 보여줍니다.
관련 코드와 모델은 GitHub 및 Hugging Face를 통해 공개되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.