AI Briefing

DeepMind의 루프형 Transformer

·2026.04.14 09:00

핵심 내용

가중치를 공유하는 루프형 Transformer로 이미지·비디오 생성 효율을 높였다.

자세히 보기

**Elastic Looped Transformers(ELT)**는 깊은 Transformer 스택 대신, 동일한 블록을 반복적으로 재사용하는 재귀형 생성 모델이다. 이를 통해 파라미터 수를 크게 줄이면서도 시각 생성 품질을 유지하는 것을 목표로 한다.

핵심은 weight sharing 기반의 반복 구조다. 일반적인 생성 모델처럼 각 층이 모두 다른 가중치를 갖는 대신, 같은 Transformer 블록을 여러 번 루프시키며 계산해 파라미터 효율성을 높인다.

학습 안정성을 위해 **Intra-Loop Self Distillation(ILSD)**도 제안한다. 최고 루프 수로 학습한 teacher configuration에서, 중간 루프의 student configuration들을 같은 한 번의 학습 과정 안에서 distillation해 깊이별 출력 일관성을 맞춘다.

이 방식으로 single training run만으로도 서로 다른 계산 예산에 맞춘 elastic model family를 만들 수 있다. 즉, 같은 파라미터 수를 유지한 채 루프 횟수에 따라 품질과 비용을 조절하는 Any-Time inference가 가능하다.

논문은 iso-inference-compute 조건에서 4배 파라미터 감소를 언급하며, 클래스 조건부 ImageNet 256×256에서 FID 2.0, 클래스 조건부 UCF-101에서 FVD 72.8을 달성했다고 밝힌다. 요약하면, ELT는 시각 생성에서 성능과 효율의 균형점을 다시 밀어 올리는 접근이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.