LG AI Research: 상식 기반의 Subgoal Planning 연구
LLM이 가진 상식을 활용해 복잡한 작업을 단계별로 계획하고, 상호 정보량 기반의 랭킹과 환경 피드백을 통해 계획의 정확도를 높이는 방법론을 제시했다.
언어 모델(LLM)이 텍스트 명령에서 일련의 중간 단계인 subgoal을 계획하는 데 유용한 상식을 인코딩할 수 있다는 점에 주목했다. 단 20개의 training 예시만으로 계획 예측에서 70%의 높은 recall을 달성하는 방법론을 제안한다.
LLM은 후보를 생성할 때 특정 단어가 자주 등장하는 popularity bias로 인해 순위가 왜곡되는 문제가 발생한다. 이를 해결하기 위해 **상호 정보량(Mutual Information)**에 근거한 순위 기준을 도입했다. 특히 쿼리와 가설 간의 관계를 결합한 가중 PMI를 활용하여 예측 성능을 개선했다.
연구팀은 ALFRED 벤치마크를 통해 성능을 검증했다. 실험 결과, 두 가지 metric을 λ = 0.5로 결합했을 때 기존 방식보다 일관되게 높은 정확도를 보이며 성능이 개선됨을 확인했다.
더 나아가 텍스트 명령뿐만 아니라 **환경 피드백(Environment Feedback)**을 통합하는 방식을 제안했다. 에이전트가 주변 환경에서 얻은 정보를 벡터화하여 re-ranker 모델에 전달함으로써, 객체 식별 오류를 줄이고 더욱 정교한 subgoal 예측이 가능하도록 설계했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.