AI Briefing

LIFT 아키텍처, 토큰 간 숨겨진 상태 전달로 Transformer 성능 향상

·2026.10.01 09:00

핵심 내용

LIFT 아키텍처가 토큰 간 숨겨진 상태를 전달해 표준 Transformer보다 성능을 개선했다.

자세히 보기

표준 Transformer는 피드포워드 네트워크로 작동하여 깊은 층의 표현을 얕은 층으로 되돌려주지 않으므로, 모델은 중간 결과를 다시 계산하고 대안적인 연속성을 폐기해야 합니다. LIFT(Latent Information Feedback Transformer) 아키텍처는 사전 학습 단계에서 생성 단계 간 상태 전파를 가능하게 하여 이 병목을 제거합니다.

LIFT의 작동 방식

이 방법은 오프더셸프(pretrained) LM에서 파생된 정보 밀도 높은 상태를 각 입력 토큰과 페어링하여 재귀 상태 학습을 예측 문제로 전환합니다. 소수의 추가 매개변수로 확장된 모델은 다음 토큰과 다음 상태를 모두 예측하도록 학습됩니다. 이러한 입력 상태가 사전 계산되므로 사전 학습 프로세스는 위치 전체에서 완전히 병렬로 유지됩니다.

성능 및 효율성

추론 시 모델은 자체 예측 상태를 사용하며, 이는 모델 크기가 커질수록 감소하는 약간의 계산 오버헤드를 유발합니다. 135M에서 1B 파라미터까지의 모델 실험 결과, LIFT는 토큰 예산이 동일한 조건에서 표준 Transformer 및 베이스라인보다 언어 모델링과 추론 작업에서 일관되게 우수한 성능을 보였으며, 컴퓨팅 예산이 동일한 Transformer와 동등하거나 이를 상회했습니다. 또한 상태 추적 작업에 대한 통제된 연구에서는 소형 LIFT 모델이 8배 더 많은 데이터로 학습된 표준 Transformer보다 성능이 뛰어났습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.