AI Briefing

RTPurbo: Full Attention의 Sparse 전환

Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps

·2026.05.26 00:03

수백 번의 짧은 학습만으로 Full Attention LLM을 고효율 Sparse 모델로 변환하는 RTPurbo 기술이 공개되었다.

기존의 효율적인 Long-context 추론 방식은 Sparse 학습이나 토큰 제거(eviction) 방식에 의존하여 효율성, 학습 비용, 정확도 사이의 트레이드오프가 발생해 왔다.

RTPurbo는 Full-attention LLM이 이미 본질적으로 희소성(intrinsic sparsity)을 가지고 있다는 점을 활용하여, 단 몇 백 번의 학습 단계만으로 모델을 고효율 Sparse 모델로 변환한다.

이 기술은 세 가지 핵심 관찰을 바탕으로 설계되었다:

  • 일부 Attention head만이 긴 문맥 처리에 실제로 필요함.
  • 장거리 검색은 저차원 부분 공간(low-dimensional subspace)에 의해 제어되므로, 16차원 인덱서로 효율적인 토큰 검색이 가능함.
  • 유용한 토큰 예산은 쿼리에 따라 달라지므로, 고정된 방식보다 동적인 top-p selection이 더 적합함.

RTPurbo는 검색용 head에만 Full KV cache를 유지하고 가벼운 토큰 인덱서를 도입하여 Sparse attention을 구현한다. 실험 결과, 1M 컨텍스트에서 Prefill 속도는 최대 9.36배, Decode 속도는 약 2.01배 향상되었으며, 정확도는 거의 손실 없이 유지하는 것으로 나타났다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.