AI Briefing

라우터 떼니 살아났다

Why dynamically routing multi-timescale advantages in PPO causes policy collapse (and a simple decoupled fix) [R]

·2026.04.16 11:47

핵심 내용

multi-timescale advantage 라우팅이 PPO를 무너뜨리는 이유와 decoupled fix를 제시한다.

자세히 보기

multi-timescale advantages(예: γ = 0.5, 0.9, 0.99, 0.999)를 Actor-Critic에 동적으로 라우팅하면, 정책이 쉽게 irreversible policy collapse에 빠지거나 이상한 local optimum에 갇힌다.

문제의 핵심은 두 가지다.

  • Surrogate Objective Hacking: temporal attention이 policy gradient에 노출되면, 최적화가 환경 제어 대신 attention weight를 조작하는 지름길을 찾는다.
  • Temporal Uncertainty Paradox: gradient-free로 우회하면 router가 aleatoric uncertainty가 낮은 short-term horizon으로 쏠려, delayed-reward 환경에서 너무 근시안적인 정책이 된다.

해결책은 Representation over Routing이다. multi-timescale prediction은 Critic 쪽에만 남겨 강한 보조 표현을 학습하게 하고, Actor는 가장 긴 장기의 advantage로만 업데이트한다.

이렇게 decouple하면 LunarLander에서 hovering에 머무르지 않고 fuel-efficient landing을 학습하며, 여러 seed에서 200점을 안정적으로 넘긴다고 주장한다. 구현은 pure PyTorch 기반의 4-stage MRE로 정리했고, crash → hover → success 과정을 짧게 재현할 수 있게 했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.