언어 모델에도 수면이 필요하다
·2026.05.27 00:36
Transformer의 문맥 확장 한계를 극복하기 위해 최근 정보를 fast weights로 압축하는 '수면' 메커니즘을 제안한다.
Transformer 기반 LLM은 긴 문맥(long-horizon) 작업을 처리할 때 attention mechanism의 확장성 문제로 인해 성능 저하를 겪습니다.
이를 해결하기 위해 최근 문맥을 지속적인 fast weights로 변환한 뒤 KV cache를 비우는 '수면과 유사한 응축 메커니즘(sleep-like consolidation mechanism)'을 제안합니다.
- 작동 원리: '수면' 시간 동안 모델은 축적된 문맥에 대해 $N$번의 오프라인 재귀적 패스(recurrent passes)를 수행하며, 학습된 규칙에 따라 SSM(State-Space Model) 블록의 fast weights를 업데이트합니다.
- 장점: 추가 연산을 수면 단계로 분산시켜, 실제 추론 시의 지연 시간(latency)을 유지하면서도 긴 문맥을 효과적으로 처리할 수 있습니다.
실험 결과, 제안된 모델은 세포 자동자, 멀티홉 그래프 검색, 수학적 추론 등 복잡한 작업에서 기존 Transformer 및 SSM-attention hybrid 모델을 능가했습니다. 특히 수면 시간($N$)을 늘릴수록 깊은 추론이 필요한 사례에서 성능이 더욱 향상되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.