순환형 Transformer: 더 큰 유효 깊이와 효율적 디코딩
핵심 내용
Recurrent Transformer가 유효 깊이와 디코딩 효율을 함께 높였다.
자세히 보기
Recurrent Transformer는 각 레이어의 key-value를 이전 레이어가 아니라 같은 레이어의 출력에서 계산해, 뒤쪽 토큰이 이미 attention과 MLP를 거친 표현을 보도록 만든다. 그 결과 표준 Transformer의 autoregressive decoding 비용은 유지하면서도, 레이어별로 독립적인 재귀 메모리를 갖는 구조가 된다.
이 구조는 약한 가정 아래 기존 Transformer의 동작을 모사할 수 있고, 반대로 이전 위치만 보도록 제한하면 토큰 간 순환 업데이트도 구현할 수 있다. 더 많은 multi-hop 경로를 만들며 RNN식 긴 경로 문제를 완화하고, normalization before key-value computation과 depth-wise residual scaling을 함께 쓰면 학습도 안정적이다.
훈련과 prefill에서는 key/value가 순차적으로 드러나기 때문에 naive 구현이 대역폭 병목에 걸리지만, 정확한 타일링 알고리즘으로 HBM 트래픽을 **Θ(N^2)**에서 **Θ(N log N)**으로 줄이고 실효 연산 집약도를 **Θ(N/log N)**까지 끌어올린다. 150M과 300M 파라미터의 C4 사전학습에서 같은 파라미터 수의 Transformer 기준선보다 cross-entropy가 개선됐고, 더 적은 레이어로도 성능을 내면서 KV cache 메모리와 추론 지연을 줄일 가능성을 보였다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.