Hugging Face, Decision Transformer 라이브러리 통합
Introducing Decision Transformers on Hugging Face 🤗
·2022.03.28 09:00
핵심 내용
Hugging Face가 오프라인 강화학습 모델인 Decision Transformer를 transformers 라이브러리에 통합했다.
자세히 보기
Hugging Face가 오프라인 강화학습(Offline RL) 방법론인 Decision Transformer를 transformers 라이브러리와 Hugging Face Hub에 통합했다.
Decision Transformer는 강화학습을 조건부 시퀀스 모델링(conditional-sequence modeling) 문제로 재정의한다. 기존 강화학습이 보상을 최대화하기 위해 가치 함수를 학습하는 방식이었다면, 이 모델은 원하는 보상(return), 과거 상태(states), 행동(actions)을 입력받아 목표 보상을 달성하기 위한 미래 행동을 생성하는 자기회귀(autoregressive) 방식을 사용한다.
이러한 접근은 강화학습 패러다임을 **생성적 궤적 모델링(generative trajectory modeling)**으로 전환한다. 이를 통해 에이전트가 환경과 직접 상호작용하지 않고도 기존의 데이터셋(인간의 시연이나 다른 에이전트의 기록)만을 활용해 학습할 수 있는 오프라인 강화학습을 가능하게 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.