백만 토큰 컨텍스트를 위한 MiniMax Sparse Attention (GitHub Repo)
·2026.06.15 09:00
핵심 내용
MiniMax가 백만 토큰 이상의 긴 컨텍스트 처리를 지원하는 Sparse Attention 기술인 MSA를 공개했다.
자세히 보기
MiniMax가 개발한 **MSA(MiniMax Sparse Attention)**는 백만 토큰 이상의 초장기 컨텍스트를 효율적으로 처리하기 위한 기술입니다. 이 라이브러리는 NVIDIA SM100 아키텍처를 타겟으로 하며, 고밀도(Dense) FlashAttention과 Sparse Top-k Attention 커널을 모두 제공합니다.
주요 구성 요소는 다음과 같습니다:
- csrc JIT: 런타임 시 Jinja 템플릿을 통해 컴파일되는 Dense FMHA 및 Sparse Top-k Select 인덱서.
- CuTe-DSL: 런타임에 컴파일되는 Full Sparse Attention(Forward + Paged FP8 Decode) 지원.
- Bridge: Sparse Prefill 경로를 위해 FMHA API를 Sparse Atten Func로 연결.
사용자는 Python 3.10 이상 환경과 NVIDIA SM100 GPU, CUDA Toolkit이 설치된 Linux x86_64 시스템에서 이를 사용할 수 있습니다. Hugging Face의 kernels 라이브러리를 통해 간편하게 호출하여 사용할 수도 있습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.