LLM 추론 효율을 높이는 PoLar 기술 연구
arXiv publication: "Skip a Layer or Loop It? Learning Program-of-Layers in LLMs"
·2026.07.22 05:32
LLM의 레이어를 동적으로 건너뛰거나 반복하여 추론 성능과 속도를 최적화하는 PoLar 기술이 제안되었습니다.
LLM은 기본적으로 모든 레이어를 고정된 순서로 실행하지만, 본 연구는 학습 없이도 레이어를 모듈처럼 구성하여 특정 입력에 맞춰 건너뛰거나 반복할 수 있는 Program-of-Layers (PoLar) 개념을 제시합니다.
연구의 주요 내용은 다음과 같습니다:
- 동적 실행 구조: 입력값에 따라 레이어를 건너뛰거나(Skip) 반복(Loop)하여 최적화된 실행 프로그램을 생성합니다.
- 효율성 및 정확도: 수학적 추론 벤치마크 결과, 기존의 고정된 레이어 실행 방식보다 더 적은 레이어를 사용하면서도 정확도를 높이거나 유지할 수 있음을 입증했습니다.
- PoLar 예측 네트워크: 경량화된 예측 네트워크를 통해 각 입력에 최적화된 실행 프로그램을 동적으로 생성하는 방식을 제안합니다.
- 잠재적 활용: 이 기술은 추론 시점에 사용자가 **추론 속도(Speed)**와 추론 능력(Competence) 사이의 트레이드오프를 직접 선택할 수 있는 유연한 추론 스택 구축을 가능하게 합니다.
실험은 Llama-3.2, Qwen1.5, Qwen2.5, Qwen3 등 다양한 오픈 웨이트 모델을 대상으로 수행되었으며, 분포 외(Out-of-distribution) 데이터에서도 성능 향상이 지속됨을 확인했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.