RTPurbo: Full Attention의 Sparse 전환
Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps
·2026.05.26 00:03
핵심 내용
수백 번의 짧은 학습만으로 Full Attention LLM을 고효율 Sparse 모델로 변환하는 RTPurbo 기술이 공개되었다.
자세히 보기
기존의 효율적인 Long-context 추론 방식은 Sparse 학습이나 토큰 제거(eviction) 방식에 의존하여 효율성, 학습 비용, 정확도 사이의 트레이드오프가 발생해 왔다.
RTPurbo는 Full-attention LLM이 이미 본질적으로 희소성(intrinsic sparsity)을 가지고 있다는 점을 활용하여, 단 몇 백 번의 학습 단계만으로 모델을 고효율 Sparse 모델로 변환한다.
이 기술은 세 가지 핵심 관찰을 바탕으로 설계되었다:
- 일부 Attention head만이 긴 문맥 처리에 실제로 필요함.
- 장거리 검색은 저차원 부분 공간(low-dimensional subspace)에 의해 제어되므로, 16차원 인덱서로 효율적인 토큰 검색이 가능함.
- 유용한 토큰 예산은 쿼리에 따라 달라지므로, 고정된 방식보다 동적인 top-p selection이 더 적합함.
RTPurbo는 검색용 head에만 Full KV cache를 유지하고 가벼운 토큰 인덱서를 도입하여 Sparse attention을 구현한다. 실험 결과, 1M 컨텍스트에서 Prefill 속도는 최대 9.36배, Decode 속도는 약 2.01배 향상되었으며, 정확도는 거의 손실 없이 유지하는 것으로 나타났다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.