AI Briefing

장기컨텍스트용 Sessa

Sessa: a new decoder architecture for long-context LLMs

·2026.04.23 23:31

핵심 내용

Sessa는 attention을 recurrent feedback path에 넣는 장기 컨텍스트용 decoder architecture다.

자세히 보기

Sessa는 attention을 한 번의 읽기 연산이 아니라 recurrent feedback path 안에 넣는 장기 컨텍스트 LLM용 decoder architecture다.

핵심은 attention을 메모리 동역학의 일부로 만들어, 시간축 전반에 걸쳐 attention-mediated path를 여러 개 형성하는 데 있다.

명시적 가정과 matched regime에서, Transformer와 Mamba-style baseline보다:

  • memory decay가 더 느리고
  • selective retrieval이 더 유연하며
  • 일부 조건에서는 effectively non-decaying influence profiles도 보인다고 제시한다.

긴 컨텍스트 처리에서 중요한 메모리 유지와 선택적 검색을 개선할 수 있는 구조를 제안하며, arXiv 논문과 GitHub 코드가 함께 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.