장기컨텍스트용 Sessa
Sessa: a new decoder architecture for long-context LLMs
·2026.04.23 23:31
Sessa는 attention을 recurrent feedback path에 넣는 장기 컨텍스트용 decoder architecture다.
Sessa는 attention을 한 번의 읽기 연산이 아니라 recurrent feedback path 안에 넣는 장기 컨텍스트 LLM용 decoder architecture다.
핵심은 attention을 메모리 동역학의 일부로 만들어, 시간축 전반에 걸쳐 attention-mediated path를 여러 개 형성하는 데 있다.
명시적 가정과 matched regime에서, Transformer와 Mamba-style baseline보다:
- memory decay가 더 느리고
- selective retrieval이 더 유연하며
- 일부 조건에서는 effectively non-decaying influence profiles도 보인다고 제시한다.
긴 컨텍스트 처리에서 중요한 메모리 유지와 선택적 검색을 개선할 수 있는 구조를 제안하며, arXiv 논문과 GitHub 코드가 함께 공개됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.