Anthropic, 2층 Transformer에서 Induction Heads가 In-context Learning의 핵심임을 밝힌 수학적 프레임워크 공개
·2026.09.12 22:56
핵심 내용
Anthropic 연구팀이 2층 Attention-only Transformer에서 Induction Heads가 In-context Learning을 수행하는 핵심 메커니즘임을 입증하는 수학적 프레임워크를 공개했다.
자세히 보기
Chris Olah이 주도한 Anthropic 연구팀은 Transformer 모델의 내부 작동 원리를 해석하기 위한 수학적 프레임워크를 제시했다. 이 연구는 Attention-only 토이 모델을 분석 대상으로 삼아, 모델 층수에 따른 알고리즘의 질적 변화를 규명했다.
층수별 알고리즘 차이와 Induction Heads
- 1층 모델의 특성: 1층 Attention-only Transformer는 Bigram 및 'Skip-trigram'(A... B C 형태) 모델의 앙상블로 동작하며, 가중치에서 직접 테이블에 접근할 수 있다. 이는 매우 단순한 형태의 In-context Learning을 구현한다.
- 2층 모델의 진화: 2층 모델에서는 Attention Head의 조합(Composition)을 통해 훨씬 복잡한 알고리즘을 구현한다. 특히 'Induction Head'라 불리는 특수한 Attention Head가 형성되어, 이는 매우 일반적인 In-context Learning 알고리즘으로 작용한다.
- 핵심 발견: 1층과 2층 모델은 In-context Learning을 수행하는 데 매우 다른 알고리즘을 사용한다. 2층 모델의 Induction Head는 추론 시점의 더 정교한 알고리즘을 나타내며, 이는 더 큰 모델과 관련된 중요한 전환점이 된다.
해석적 접근
- 가중치 기반 분석: 연구팀은 2층 모델의 조합 알고리즘이 가중치에서 직접 감지될 수 있음을 밝혔다. 또한 MLP 레이어의 뉴런은 일반적으로 Polysemantic(다의미)하여 해석이 어렵다는 점과 Superposition 이론은 별도의 후속 연구로 이어졌다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.