Attention-Only Transformer에 대한 통제된 연구
핵심 내용
FFN을 제거해도 예산을 재배분하면 Transformer 성능 격차가 거의 사라졌다.
자세히 보기
Attention-Only Transformer, 즉 Feed-Forward Network(FFN) 없이 어텐션만 사용하는 **Simple Attention Network(SAN)**를 표준 Transformer와 비교한 통제 실험이 진행됐다. 연구진은 파라미터 수, 학습 FLOPs, 레이어 깊이를 각각 맞춰 600만~8,700만 파라미터 규모에서 최대 1,050억 토큰을 학습했다.
FFN을 기존 위치에서 단순히 제거하면 표준 Transformer가 더 나았다. 같은 깊이에서는 손실 차이가 0.47 nat, 같은 학습 FLOPs에서는 0.26 nat였지만, 절약한 예산을 어텐션 레이어 깊이에 재투자하자 같은 파라미터 수 기준 격차는 0.006 nat까지 줄었다.
SAN은 문맥에 근거한 답변에서는 더 강했지만, 모델 가중치에 저장된 지식이 필요한 과제에서는 약했다. 연구진은 이 차이를 parametric recall 문제로 설명했으며, 지식이 밀집된 웹 텍스트에서 예측한 0.02~0.05 nat의 격차는 FineWeb-Edu 실험에서 0.040 nat로 측정됐다.
가중치 분석에서는 Q/K 라우팅 행렬이 빠르게 구조화되고 콘텐츠 행렬의 rank가 느리게 증가하는 현상이 나타났다. 48층 Attention-Only 모델을 학습 가능하게 유지한 핵심 요소는 FFN이나 residual gating이 아니라 QK-normalization이었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.