HOLA: 선형 어텐션의 메모리 한계 극복
A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
·2026.07.07 12:46
선형 어텐션의 압축 과정에서 발생하는 정보 손실을 방지하기 위해 해마 구조를 도입한 HOLA 모델이 공개되었습니다.
선형 어텐션(Linear-attention) 및 상태 공간 모델(SSM)은 고정된 크기의 재귀적 상태(Recurrent state)를 사용하여 메모리 효율성을 높이지만, 정보가 압축되는 과정에서 초기 데이터가 덮어씌워지는 정보 손실(Lossy memory) 문제가 발생합니다.
새롭게 제안된 **HOLA(Hippocampal Linear Attention)**는 보완적 학습 시스템(Complementary Learning Systems)에서 영감을 받아, 기존의 압축 메모리인 delta-rule state 외에 **경계가 있는 정확한 KV 캐시(Bounded exact KV cache)**를 추가하여 이 문제를 해결합니다.
주요 특징 및 성과:
- 세미 파라미터 테스트 타임 메모리: 상태(State)는 선형적으로 압축 가능한 구조를 모델링하고, 캐시는 상태에 담기 어려운 중요한 연관 관계를 저장합니다.
- 효율적인 캐시 관리: 학습된 제거 모듈 없이, 예측 잔차(Prediction residual)가 큰 토큰을 선별하여 캐시에 유지합니다.
- 성능 향상: 340M 파라미터 모델 기준, Wikitext perplexity를 27.32에서 22.92로 16.1% 개선하며 Transformer++ 성능을 상회했습니다.
- 긴 문맥 유지: RULER 벤치마크의 Needle-in-a-haystack 테스트에서 훈련 길이의 16배인 32k 토큰까지 매우 강력한 검색 성능을 유지합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.