Wall Attention (GitHub 저장소)
·2026.06.03 09:00
채널별 곱셈 감쇠를 적용해 효율적인 학습과 추론을 지원하는 Wall Attention이 공개되었다.
Wall Attention은 QK 내적에 **채널별, 타임스텝별 곱셈 감쇠(per-channel, per-timestep multiplicative decay)**를 통합한 새로운 어텐션 변형 방식이다. 기존 어텐션이 두 위치 사이의 점수를 계산할 때 모든 채널을 동일하게 처리하는 것과 달리, Wall Attention은 각 채널에 대해 독립적이고 콘텐츠에 따라 달라지는 망각률(forgetting rate)을 적용한다.
이 방식은 스칼라 게이팅(FoX)이나 RoPE 스타일의 감쇠를 전체 채널 차원으로 일반화한 것이 특징이다. 감쇠 계수 $g$를 0으로 설정하면 기존의 Vanilla Softmax Attention과 동일하게 동작한다.
이 저장소는 실제 활용을 위한 두 가지 핵심 커널을 제공한다.
- Training / Prefill (
wall_attn): $q, k, v, g$에 대한 해석적 그래디언트(analytic gradients)를 지원하는 융합된(fused) Triton 커널이다. - Decode (
wall_attn_decode): **사전 재조정된 KV 캐시(pre-rescaled KV cache)**를 읽어 들여, 토큰 생성 시 전체 접두사를 재계산할 필요 없이 효율적인 추론을 가능하게 한다.
주요 기능으로는 GQA(Grouped Query Attention) 지원, Attention Sink, Sliding Window, 그리고 가변 길이 패킹(Varlen Packing) 등이 있다. 특히 사전 재조정된 디코딩 캐시는 긴 컨텍스트에서도 수치적으로 안정적이며 저렴한 자기회귀(autoregressive) 생성을 지원한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.