LG AI Research 206
·2026.07.16 09:00
핵심 내용
구조 임베딩을 활용해 로봇의 형태 정보를 반영한 범용 정책 모델 SWAT을 소개한다.
1 / 2
자세히 보기
기존의 강화학습 방식은 특정 문제를 해결하는 단일 정책만을 학습하여 데이터 효율이 낮다는 한계가 있었다. 이를 해결하기 위해 다양한 로봇을 동시에 제어할 수 있는 단일 범용 정책(Single General-purpose Policy) 연구가 주목받고 있다.
다관절 로봇 제어 시 로봇마다 구조와 크기가 다르다는 점이 핵심 과제다. 기존의 그래프 신경망(GNN) 방식은 메시지 패싱 과정에서 노드 간 정보가 섞이는 오버스무딩(Over-smoothing) 문제가 발생하며, 트랜스포머(Transformer) 방식은 로봇의 물리적 형태 정보를 충분히 반영하지 못하는 한계가 있다.
이를 극복하기 위해 제안된 모델이 바로 **SWAT(Structure-aWAre Transformer Policy)**이다. SWAT은 트랜스포머 모델에 로봇의 형태를 반영하는 **구조 임베딩(Structural Embedding)**을 결합했다.
구조 임베딩은 다음과 같이 구성된다:
- 위치 임베딩(Positional Embedding): 트리 순회 방식을 통해 그래프 상의 노드 위치를 표현
- 관계 임베딩(Relational Embedding): 라플라시안 행렬, 최단 거리, 개인화된 PageRank 등을 통해 노드 간 관계를 표현
SWAT 모델은 '인코딩-메시지 패싱-디코딩'의 3단계를 거쳐, 로봇의 센서 정보와 구조적 특징을 모두 반영한 최적의 행동을 결정한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.