AI Briefing

TRL-PEFT 통합으로 RLHF 지원

Fine-tuning 20B LLMs with RLHF on a 24GB consumer GPU

·2023.03.09 09:00

Hugging Face가 TRL과 PEFT를 통합하여 소비자용 GPU에서도 20B 규모의 LLM RLHF 학습이 가능하도록 지원한다.

Hugging Face의 trl 라이브러리와 peft 라이브러리가 공식 통합되었다. 이번 업데이트를 통해 메모리 소모가 매우 큰 RLHF(Reinforcement Learning with Human Feedback) 과정을 훨씬 더 효율적으로 수행할 수 있게 되었다.

기존에는 10B 이상의 모델을 RLHF로 학습하기 위해 막대한 GPU 메모리가 필요했으나, PEFT(Parameter-Efficient Fine-Tuning) 기술을 활용하면 24GB VRAM을 탑재한 소비자용 GPU에서도 20B 규모의 LLM 미세 조정이 가능하다.

trl은 다음과 같은 핵심 기능을 제공한다:

  • PPO 알고리즘을 단일 장치 또는 분산 환경에서 실행 가능
  • accelerate를 활용한 실험 확장성 지원
  • 모델 레이어 공유를 통한 메모리 절약 기능

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.