Hugging Face, Decision Transformer 라이브러리 통합
Introducing Decision Transformers on Hugging Face 🤗
·2022.03.28 09:00
Hugging Face가 오프라인 강화학습 모델인 Decision Transformer를 transformers 라이브러리에 통합했다.
Hugging Face가 오프라인 강화학습(Offline RL) 방법론인 Decision Transformer를 transformers 라이브러리와 Hugging Face Hub에 통합했다.
Decision Transformer는 강화학습을 조건부 시퀀스 모델링(conditional-sequence modeling) 문제로 재정의한다. 기존 강화학습이 보상을 최대화하기 위해 가치 함수를 학습하는 방식이었다면, 이 모델은 원하는 보상(return), 과거 상태(states), 행동(actions)을 입력받아 목표 보상을 달성하기 위한 미래 행동을 생성하는 자기회귀(autoregressive) 방식을 사용한다.
이러한 접근은 강화학습 패러다임을 **생성적 궤적 모델링(generative trajectory modeling)**으로 전환한다. 이를 통해 에이전트가 환경과 직접 상호작용하지 않고도 기존의 데이터셋(인간의 시연이나 다른 에이전트의 기록)만을 활용해 학습할 수 있는 오프라인 강화학습을 가능하게 한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.