AI Briefing

Microsoft의 Full-bandwidth Transformer

·2026.08.17 09:00

핵심 내용

Microsoft가 모델의 수직적 피드백 채널을 확장해 학습 효율과 성능을 높인 Full-bandwidth Transformer를 제안했다.

자세히 보기

기존의 자기회귀(Autoregressive) Transformer는 토큰 간의 수평적 접근은 뛰어나지만, 모델의 깊이 방향인 수직적 피드백 채널은 매우 좁다. 디코딩 과정에서 샘플링된 토큰만 다시 입력될 뿐, 최상위 레이어의 은닉 상태(hidden state)는 버려지기 때문이다.

Full-bandwidth Transformer는 이 문제를 해결하기 위해 Latent Feedback 메커니즘을 도입했다. 각 디코딩 단계에서 이전 단계의 최상위 은닉 상태를 Gated Linear Unit을 통해 샘플링된 토큰 임베딩과 결합하여 다음 입력으로 다시 전달한다. 이를 통해 비언어적(non-verbalized) 계산 결과가 모델의 깊이 예산(depth budget) 내에서 재사용될 수 있도록 한다.

이 구조는 기존의 Transformer 아키텍처, KV Cache, 언어 모델링 목적 함수를 그대로 유지한다는 장점이 있다. 1B 파라미터 모델을 400B 토큰까지 학습시킨 결과, 수학, 코딩, 지시 이행(instruction-tuned) 성능이 크게 향상되었다.

특히 Full-bandwidth Transformer는 기존 모델보다 약 1.5배 더 많은 토큰을 학습한 것과 맞먹는 성능을 보여주면서도, 디코딩 시 발생하는 오버헤드는 매우 적다. 또한, 동일하거나 더 높은 정확도를 유지하면서도 더 짧은 추론 과정(reasoning traces)을 생성할 수 있음을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.