RLHF의 핵심 단계와 작동 원리
Illustrating Reinforcement Learning from Human Feedback (RLHF)
·2022.12.09 09:00
핵심 내용
인간의 피드백을 통해 언어 모델을 최적화하는 RLHF의 개념과 3단계 학습 과정을 설명한다.
1 / 2
자세히 보기
언어 모델이 생성한 텍스트의 품질을 정의하는 것은 매우 주관적이며 어렵다. 기존의 BLEU나 ROUGE 같은 지표는 단순 규칙 기반의 비교에 그치는 한계가 있다. 이를 해결하기 위해 인간의 피드백을 사용하여 모델을 직접 최적화하는 RLHF(Reinforcement Learning from Human Feedback) 기술이 활용된다.
RLHF는 모델을 인간의 복잡한 가치관에 정렬(Alignment)시키는 데 핵심적인 역할을 하며, 과정은 크게 세 단계로 구분된다.
-
1단계: 언어 모델 사전 학습(Pretraining) 대규모 말뭉치로 학습된 기존 언어 모델을 기초로 시작한다. 핵심은 다양한 지시사항(Instruction)에 적절히 반응할 수 있는 모델을 확보하는 것이다.
-
2단계: 보상 모델(Reward Model) 학습 인간의 선호도를 시스템에 통합하는 단계다. 텍스트 시퀀스를 입력받아 인간의 선호도를 수치화한 스칼라(scalar) 보상값을 반환하는 모델을 학습시킨다.
-
3단계: 강화 학습을 통한 미세 조정(Fine-tuning) 학습된 보상 모델을 활용하여 언어 모델을 강화 학습 방식으로 최적화한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.