AI Briefing

DT 학습 가이드

Train your first Decision Transformer

·2022.09.08 09:00

강화학습을 시퀀스 모델링으로 해결하는 Decision Transformer의 개념과 학습 방법을 소개한다.

Decision Transformer는 강화학습(RL)을 조건부 시퀀스 모델링(conditional-sequence modeling) 문제로 재정의하여 해결하는 새로운 패러다임을 제시한다.

기존 RL이 보상을 최대화하기 위해 가치 함수를 최적화하는 방식이었다면, Decision Transformer는 Transformer를 사용하여 목표 보상(Return-to-go), 과거 상태, 행동의 시퀀스를 입력받아 미래 행동을 생성하는 생성적 궤적 모델링(generative trajectory modeling) 방식을 채택한다.

주요 특징 및 학습 방법은 다음과 같다:

  • 입력 구조: 마지막 K개의 타임스텝에 대해 Return-to-go, State, Action 세 가지 요소를 입력으로 사용한다.
  • 모델 아키텍처: 입력된 토큰은 임베딩 과정을 거쳐 GPT-2 모델로 전달되며, 인과적 셀프 어텐션(causal self-attention)을 통해 미래 행동을 자기회귀(autoregressive) 방식으로 예측한다.
  • 실습 내용: Hugging Face의 transformers 라이브러리와 Trainer API를 활용하여, HalfCheetah 환경의 오프라인 데이터셋을 기반으로 모델을 처음부터 학습시키는 과정을 다룬다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.