AI Briefing

LG AI Research 294

·2026.07.16 09:00

상태 정보만을 이용해 전문가의 행동을 모방하는 오프라인 관찰 학습(LfO)의 안정성을 높이는 새로운 알고리즘을 제안한다.

기존의 **모방 학습(IL)**은 전문가의 행동(Action) 정보가 필수적이었으나, 인간은 운전이나 영상 시청처럼 상태(State) 변화만을 관찰하고도 학습할 수 있다. 이를 모방하는 기술을 **관찰 학습(LfO, Learning from Observation)**이라 한다.

기존의 오프라인 LfO 방식은 환경과의 상호작용 없이 미리 수집된 데이터를 사용하지만, 두 가지 주요 한계가 존재한다. 첫째, Off-policy LfO 알고리즘은 분포 외(OOD) 액션 값 사용으로 인해 학습이 불안정하다. 둘째, **역 동역학 모델(Inverse Dynamics Model)**을 사용하는 방식은 확률적 환경에서 전문가의 행동을 정확히 예측하는 데 한계가 있다.

본 연구는 이러한 문제를 해결하기 위해 새로운 수식 기반의 알고리즘을 제안한다. KL Divergence 최소화와 정규화 기법을 활용하여, 데이터의 분포를 벗어나지 않으면서도 오프라인 환경에서 최적의 성능을 낼 수 있도록 설계되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.