MSA, 1억 토큰 메모리 모델 발표
MSA 100M tokens
·2026.05.07 02:44
MSA는 1억 토큰까지 확장하는 메모리 스파스 어텐션을 발표했다.
MSA는 retrieval과 generation을 하나의 end-to-end 루프로 묶는 latent-memory 프레임워크다. 기존 full attention 병목을 줄이기 위해 document-wise RoPE와 sparse attention을 결합해 긴 문서 집합을 메모리처럼 다루는 방식을 제안한다.
핵심 구성은 다음과 같다.
- Scalable sparse attention + document-wise RoPE로 학습/추론 복잡도를 거의 선형으로 유지한다.
- KV cache compression과 Memory Parallel로 2xA800 GPU에서 100M token 추론을 목표로 한다.
- Memory Interleave로 흩어진 메모리 구간 사이의 다중 홉 추론을 강화한다.
평가에서는 Qwen3-4B-Instruct-2507 백본으로 MS MARCO v1, NQ, DuReader, TriviaQA, NarrativeQA, PopQA, 2WikiMultiHopQA, HotpotQA, MuSiQue와 NIAH(RULER) 를 테스트했다. 논문은 동일 백본 RAG, 상위 RAG 스택, 주요 long-context 모델보다 우수하다고 보고하며, 16K→100M tokens 구간에서 성능 저하를 9% 미만으로 제시한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.