AI Briefing

LG AI 연구원: 상태 정보만으로 학습하는 오프라인 모방학습 방법론 제시

·2026.07.16 09:00

상태 정보만 있는 전문가 시연을 활용해 오프라인 환경에서도 안정적으로 학습할 수 있는 새로운 모방학습 방법론을 제안했다.

기존의 **모방학습(Imitation Learning)**은 전문가의 행동(Action) 정보가 필수적이었으나, 인간은 행동 정보 없이 관찰(Observation)만으로도 학습이 가능하다. 이를 모방하는 Learning from Observation 연구가 진행되어 왔으나, 환경과의 직접적인 상호작용이 필요해 비용과 위험이 크다는 단점이 있었다.

본 논문은 위험 부담이 큰 실시간 상호작용 대신, 사전에 수집된 불완전한 시연을 활용하는 오프라인 Learning from Observation 문제를 해결하고자 한다. 기존의 Off-policy 방식은 Out-of-distribution 액션 값 사용으로 인해 불안정하며, Inverse Dynamics Model을 활용하는 방식은 확률적(Stochastic) 환경에서 정확한 행동 예측이 어렵다는 한계가 있다.

이를 해결하기 위해 본 연구는 수식에 기반한 새로운 알고리즘을 제시한다. 핵심은 KL Regularization을 통해 데이터 지지집합(Support)에서 벗어나지 않도록 제약하는 것이며, 상태-전이 분포 매칭과 불완전한 시연 분포 사이의 균형을 맞추는 최적화 문제를 통해 안정적인 성능을 달성한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.