HuggingFace, RLOO 트레이너 공개
Putting RL back in RLHF
·2024.06.12 09:00
HuggingFace가 PPO보다 메모리 효율이 높고 속도가 빠른 새로운 RLHF 알고리즘인 RLOO 트레이너를 TRL에 도입했다.
HuggingFace의 TRL 라이브러리에 새로운 온라인 RLHF 학습 알고리즘인 RLOO(REINFORCE Leave One-Out) 트레이너가 추가되었습니다. RLOO는 기존 PPO 방식의 높은 메모리 요구량과 구현 복잡성을 해결하기 위해 설계되었습니다.
주요 특징 및 장점:
- 메모리 절감: PPO는 4개의 모델(Policy, Reference, Reward, Value)을 로드해야 하지만, RLOO는 3개(Policy, Reference, Reward)만 필요하여 vRAM 사용량을 약 50~70% 절감합니다.
- 학습 속도 향상: 1B 모델 기준 2배, 6.9B 모델 기준 최대 3배 더 빠른 수렴 속도를 보입니다.
- 우수한 성능: GPT-4 기반 평가에서 PPO와 대등한 성능을 기록했으며, DPO와 같은 오프라인 학습 방식보다 뛰어난 결과를 나타냅니다.
작동 원리: RLOO는 각 토큰을 개별 액션으로 처리하는 PPO와 달리, 전체 문장(Completion)을 하나의 액션으로 모델링합니다. 이를 통해 보상이 희소하게 주어지는 환경에서도 더 효율적인 학습이 가능합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.