SATFormer: 효율적인 표현 재사용 구조
Transformers with Selective Access to Early Representations [R]
·2026.05.06 10:44
초기 레이어의 표현을 토큰 및 헤드별로 선택적으로 재사용하여 효율성을 높인 SATFormer를 제안한다.
최근 Transformer 변형 모델들은 정보 흐름을 개선하기 위해 초기 레이어의 표현을 후기 레이어에 노출시키는 방식을 사용해 왔습니다. 하지만 이는 연산량과 메모리 비용을 증가시키는 단점이 있습니다.
SATFormer는 모든 레이어에 초기 특징을 일률적으로 복사하는 대신, **토큰별, 헤드별, 문맥 의존적 게이트(context-dependent gate)**를 도입하여 첫 번째 레이어의 value 스트림에 접근할 시점과 위치를 학습합니다.
주요 성과:
- 성능 향상: 130M~1.3B 규모 모델에서 Transformer 및 ResFormer 대비 검증 손실(validation loss) 개선.
- 검색 성능: Retrieval-intensive 벤치마크에서 MUDDFormer를 근소하게 앞지르고 ResFormer보다 평균 1.5점 높은 점수 기록.
- 높은 처리량(Throughput): HyperConnections나 MUDDFormer보다 훨씬 빠른 Transformer/ResFormer 수준의 처리량 유지.
- 메커니즘 분석: 게이트가 단순한 잔차 연결(residual shortcut)이 아니라, 희소하고(sparse), 깊이에 의존하며(depth-dependent), 헤드별로 특화된(head-specific) 방식으로 작동함을 확인.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.