AI Briefing

Apple, 루프 트랜스포머 연산량 최대 48% 줄이는 'LoopCD' 연구 발표

LoopCD: 루프 트랜스포머의 첫 반복을 약한 참조로 쓰는 학습 없는 대조 디코딩에 대한 Apple의 연구

·2026.10.08 11:30

핵심 내용

추가 학습 없이 루프 트랜스포머의 첫 반복 예측을 참조로 해 추론 정확도를 높이고 이론적 연산량을 최대 48.2%까지 줄이는 기법이다.

1 / 8

자세히 보기

Apple 연구팀이 루프 트랜스포머의 추론 성능을 높이는 학습 없는 대조 디코딩 방법 LoopCD를 제안했습니다. 이 기법은 추가 학습이나 보조 모델 없이 추론 시점에 적용되며, 루프 구조의 첫 번째 반복(h1) 예측을 약한 참조로, 마지막 반복(hR) 예측을 강한 예측으로 활용해 대조 디코딩을 수행합니다.

핵심 원리 및 변형

LoopCD는 두 가지 변형으로 제공됩니다.

  • LoopCD-Logits: 로짓 공간에서 결합하며, 출력 층을 두 번 실행해야 합니다.
  • LoopCD-Hidden: 은닉 상태 공간에서 결합하며, 출력 층을 한 번만 실행해 연산량 증가가 거의 없습니다.

가이던스 강도(ω)는 고정 방식 또는 토큰별 확률 차이에 따라 조절하는 적응 방식으로 설정할 수 있습니다.

주요 성능 개선

Ouro, Huginn, Parcae, Looped-Qwen3 등 소형 모델(0.37B~4B급)을 대상으로 한 실험에서 다음과 같은 결과가 나타났습니다.

  • 수학 추론: Ouro-2.6B-Thinking의 AIME 2024 pass@1 점수가 61.88%에서 **73.33%**로 상승했습니다.
  • 코드 생성: Huginn-0125 모델의 HumanEval pass@1 점수가 LoopCD-Hidden 적용 시 22.56%에서 **31.71%**로 개선되었습니다.
  • 연산 효율: 반복 횟수를 절반으로 줄인 설정에서 전체 반복 일반 디코딩과 동등 이상의 정확도를 유지하며, 이론적 FLOPs를 22.5%~48.2% 절감했습니다.

한계 및 주의사항

  • 검증 범위: 4B 이하 소형 모델에서만 검증되어 대형 모델에서의 효과는 미확인 상태입니다.
  • 일관성 부족: Looped-Qwen3의 수학 추론 pass@1이나 GSM8K 등 일부 벤치마크에서는 성능이 하락한 항목도 보고되었습니다.
  • 실제 지연 시간: 연산량 절감은 이론적 FLOPs 값이며, 실제 서빙 환경에서의 지연 시간(wall-clock) 감소 효과는 측정되지 않았습니다.
  • 코드 공개: Apple은 코드를 공개하지 않았으나, 유사한 아이디어를 제시한 POSTECH 연구의 저장소가 현재 사용 가능합니다(단, Apple의 은닉 상태 변형 등은 미포함).

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.