AI Briefing

LLM 추론 효율을 높이는 PoLar 기술 연구

arXiv publication: "Skip a Layer or Loop It? Learning Program-of-Layers in LLMs"

·2026.07.22 05:32

핵심 내용

LLM의 레이어를 동적으로 건너뛰거나 반복하여 추론 성능과 속도를 최적화하는 PoLar 기술이 제안되었습니다.

자세히 보기

LLM은 기본적으로 모든 레이어를 고정된 순서로 실행하지만, 본 연구는 학습 없이도 레이어를 모듈처럼 구성하여 특정 입력에 맞춰 건너뛰거나 반복할 수 있는 Program-of-Layers (PoLar) 개념을 제시합니다.

연구의 주요 내용은 다음과 같습니다:

  • 동적 실행 구조: 입력값에 따라 레이어를 건너뛰거나(Skip) 반복(Loop)하여 최적화된 실행 프로그램을 생성합니다.
  • 효율성 및 정확도: 수학적 추론 벤치마크 결과, 기존의 고정된 레이어 실행 방식보다 더 적은 레이어를 사용하면서도 정확도를 높이거나 유지할 수 있음을 입증했습니다.
  • PoLar 예측 네트워크: 경량화된 예측 네트워크를 통해 각 입력에 최적화된 실행 프로그램을 동적으로 생성하는 방식을 제안합니다.
  • 잠재적 활용: 이 기술은 추론 시점에 사용자가 **추론 속도(Speed)**와 추론 능력(Competence) 사이의 트레이드오프를 직접 선택할 수 있는 유연한 추론 스택 구축을 가능하게 합니다.

실험은 Llama-3.2, Qwen1.5, Qwen2.5, Qwen3 등 다양한 오픈 웨이트 모델을 대상으로 수행되었으며, 분포 외(Out-of-distribution) 데이터에서도 성능 향상이 지속됨을 확인했습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.