장기컨텍스트용 Sessa
Sessa: a new decoder architecture for long-context LLMs
·2026.04.23 23:31
핵심 내용
Sessa는 attention을 recurrent feedback path에 넣는 장기 컨텍스트용 decoder architecture다.
자세히 보기
Sessa는 attention을 한 번의 읽기 연산이 아니라 recurrent feedback path 안에 넣는 장기 컨텍스트 LLM용 decoder architecture다.
핵심은 attention을 메모리 동역학의 일부로 만들어, 시간축 전반에 걸쳐 attention-mediated path를 여러 개 형성하는 데 있다.
명시적 가정과 matched regime에서, Transformer와 Mamba-style baseline보다:
- memory decay가 더 느리고
- selective retrieval이 더 유연하며
- 일부 조건에서는 effectively non-decaying influence profiles도 보인다고 제시한다.
긴 컨텍스트 처리에서 중요한 메모리 유지와 선택적 검색을 개선할 수 있는 구조를 제안하며, arXiv 논문과 GitHub 코드가 함께 공개됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.