AI Briefing

[AAMAS 2024] 현실 세계 적용을 위한 Multi-Agent Reinforcement Learning (2편)

·2026.07.16 09:00

비동기적 환경에서 에이전트 간 관측 시점 차이를 극복하기 위해 AOCC 구조를 제안하여 MARL 학습 효율을 높였다.

현실 세계의 문제에서는 에이전트마다 행동의 지속시간이나 시작 시점이 서로 다른 Asynchronous MARL 상황이 빈번하게 발생한다. 기존 연구들은 비동기적으로 수집된 데이터를 처리하기 위해 에이전트별 독립적 히스토리인 Mac-CERTs와 전체 에이전트의 종합 히스토리인 Mac-JERTs를 활용해 왔다.

하지만 기존의 Mac-JERTs 방식은 최신 관측이 없는 시점의 에이전트 기록을 처리할 때 마지막 관측을 중복 입력으로 사용함으로써 히스토리를 효과적으로 표현하지 못하는 한계가 있었다.

LG AI 연구원은 이를 해결하기 위해 Agent-Oriented Centralized Critic (AOCC) 구조를 제안했다. 이 구조는 다음과 같은 핵심 요소로 구성된다.

  • Agent-oriented History Encoder: Mac-CERTs로 구성된 에이전트별 히스토리를 인코딩한다.
  • Aggregation Module: 각 에이전트의 히스토리 인코딩을 취합하며, 시점 혼동을 방지하기 위해 Positional Encoding을 추가한다.

이러한 구조를 통해 중복된 관측 입력을 피하고 더 효과적인 히스토리 구성을 가능하게 하여, 가치 함수와 행동 정책 학습의 성능을 높였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.