LG AI Research 206
·2026.07.16 09:00
구조 임베딩을 활용해 로봇의 형태 정보를 반영한 범용 정책 모델 SWAT을 소개한다.
기존의 강화학습 방식은 특정 문제를 해결하는 단일 정책만을 학습하여 데이터 효율이 낮다는 한계가 있었다. 이를 해결하기 위해 다양한 로봇을 동시에 제어할 수 있는 단일 범용 정책(Single General-purpose Policy) 연구가 주목받고 있다.
다관절 로봇 제어 시 로봇마다 구조와 크기가 다르다는 점이 핵심 과제다. 기존의 그래프 신경망(GNN) 방식은 메시지 패싱 과정에서 노드 간 정보가 섞이는 오버스무딩(Over-smoothing) 문제가 발생하며, 트랜스포머(Transformer) 방식은 로봇의 물리적 형태 정보를 충분히 반영하지 못하는 한계가 있다.
이를 극복하기 위해 제안된 모델이 바로 **SWAT(Structure-aWAre Transformer Policy)**이다. SWAT은 트랜스포머 모델에 로봇의 형태를 반영하는 **구조 임베딩(Structural Embedding)**을 결합했다.
구조 임베딩은 다음과 같이 구성된다:
- 위치 임베딩(Positional Embedding): 트리 순회 방식을 통해 그래프 상의 노드 위치를 표현
- 관계 임베딩(Relational Embedding): 라플라시안 행렬, 최단 거리, 개인화된 PageRank 등을 통해 노드 간 관계를 표현
SWAT 모델은 '인코딩-메시지 패싱-디코딩'의 3단계를 거쳐, 로봇의 센서 정보와 구조적 특징을 모두 반영한 최적의 행동을 결정한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.