AI Briefing

실제 환경 적용을 위한 멀티 에이전트 강화 학습

·2026.07.16 09:00

LG AI Research가 비동기 멀티 에이전트 강화 학습(MARL)의 효율성을 높이는 AOCC 아키텍처를 제안했다.

실제 산업 현장에서는 각 에이전트의 행동 시작 시점이나 지속 시간이 서로 다른 비동기적(Asynchronous) 상황이 빈번하게 발생한다. 기존의 비동기 MARL 연구는 주로 비동기적으로 수집된 데이터를 처리하는 방식에 집중해 왔다.

대부분의 MARL은 CTDE(Centralized Training Decentralized Execution) 구조를 따른다. 이는 행동을 결정하는 Decentralized Actor와 가치를 평가하는 Centralized Critic을 각각 학습시키는 방식이다. 특히 각 에이전트가 서로 다른 길이의 매크로 액션을 수행하는 MacDec-POMDP 환경에서는 에이전트 간 관측 시점이 일치하지 않아 히스토리를 구성하는 것이 까다롭다.

기존 연구에서는 모든 에이전트의 관측을 통합하는 Mac-JERTs 방식을 사용했으나, 이는 최신 관측이 없는 에이전트의 데이터를 중복 생성하여 히스토리를 왜곡할 위험이 있었다.

LG AI Research는 이를 해결하기 위해 AOCC(Agent-Oriented Centralized Critic) 아키텍처를 제안한다. 이 구조는 다음과 같은 특징을 갖는다.

  • 에이전트 지향 히스토리 인코더: 각 에이전트의 개별 히스토리(Mac-CERTs)를 인코딩한다.
  • 어그리게이션 모듈: 인코딩된 각 에이전트의 정보를 통합한다.
  • 포지셔널 인코딩: 에이전트 간 관측 타이밍 혼선을 방지하기 위해 각 타임스텝에 위치 정보를 추가한다.

이러한 설계를 통해 중복된 관측값 없이 히스토리를 체계적으로 정리하여, 가치 함수와 행동 정책을 더욱 효과적으로 학습할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.