AI Briefing

백만 토큰 컨텍스트를 위한 MiniMax Sparse Attention (GitHub Repo)

·2026.06.15 09:00

MiniMax가 백만 토큰 이상의 긴 컨텍스트 처리를 지원하는 Sparse Attention 기술인 MSA를 공개했다.

MiniMax가 개발한 **MSA(MiniMax Sparse Attention)**는 백만 토큰 이상의 초장기 컨텍스트를 효율적으로 처리하기 위한 기술입니다. 이 라이브러리는 NVIDIA SM100 아키텍처를 타겟으로 하며, 고밀도(Dense) FlashAttention과 Sparse Top-k Attention 커널을 모두 제공합니다.

주요 구성 요소는 다음과 같습니다:

  • csrc JIT: 런타임 시 Jinja 템플릿을 통해 컴파일되는 Dense FMHA 및 Sparse Top-k Select 인덱서.
  • CuTe-DSL: 런타임에 컴파일되는 Full Sparse Attention(Forward + Paged FP8 Decode) 지원.
  • Bridge: Sparse Prefill 경로를 위해 FMHA API를 Sparse Atten Func로 연결.

사용자는 Python 3.10 이상 환경과 NVIDIA SM100 GPU, CUDA Toolkit이 설치된 Linux x86_64 시스템에서 이를 사용할 수 있습니다. Hugging Face의 kernels 라이브러리를 통해 간편하게 호출하여 사용할 수도 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.