LLM, 스스로 주의 범위 선언
Language Models Can Control Their Own Attention [R]
·2026.09.05 15:07
핵심 내용
언어 모델이 사고 과정 중 주의가 필요한 영역을 스스로 선언해 연산 비용을 최대 52% 줄이는 'Declarative Attention' 기법이 공개됐다.
자세히 보기
장문 컨텍스트 처리 시 전체 KV 캐시를 스캔하는 비효율을 해결하기 위해, 모델이 스스로 주의 집중 범위를 선언하는 Declarative Attention(DA) 프로토콜이 제안됐다.
기존의 외부 점수 기반 토큰 선택 방식은 여전히 단계별 O(N) 비용이 발생하지만, DA는 모델이 체인 오브 소트(CoT) 과정에서 전체 컨텍스트, 특정 영역, 최근 출력 중 어디를 봐야 하는지 명시하도록 유도한다. 추론 엔진은 이 선언을 도구 호출처럼 파싱하여 불필요한 KV 캐시 읽기를 건너뛴다.
주요 성과 및 특징
- 연산 효율성: Gemma-4-31B와 Qwen-3.6-27B 모델에서 디코딩 중 총 주의 토큰 수를 각각 52.0%, 31.1% 감소시켰다.
- 정확도 유지: 15개의 장문 컨텍스트 작업에서 정확도 저하는 각각 1.27pp, 2.75pp에 불과하며, 모델 규모가 커질수록 저하 폭은 줄어든다.
- 확장성: 학습 기반 방법론과 결합 시 더 큰 잠재력을 가질 것으로 기대되는 새로운 희소 주의(Sparse Attention) 축을 제시한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.