LLM 정책 그래디언트 유도: REINFORCE에서 GRPO까지 및 추론 불일치 대응
핵심 내용
REINFORCE에서 GRPO로 이어지는 LLM 정책 그래디언트 유도법과 추론 엔진 불일치 문제를 다뤘다.
자세히 보기
REINFORCE에서 정책 그래디언트로
LLM을 위한 정책 그래디언트 추정식을 REINFORCE 알고리즘부터 유도한다. 목적함수의 그래디언트는 정책에서 샘플링한 완결 문장(completions)과 보상(reward)으로 가중치 부여된 점수 함수($\nabla_\theta \log p_\theta(y)$)로 추정할 수 있다. 이는 '보상으로 가중치를 준 자체 샘플에 대한 지도 미세 조정'으로 설명된다. REINFORCE는 편향(bias)이 없지만 분산(variance)이 높다는 점이 지적된다.
베이스라인과 GRPO
분산을 줄이기 위해 보상에서 베이스라인 $b$를 차감하여 이점 $A = R - b$를 계산한다. 이는 기대 그래디언트를 변경하지 않으면서 분산을 크게 감소시킨다. 특히 GRPO(Group Relative Policy Optimization)는 $G$개의 완결 문장 그룹 평균 보상을 크리틱 없는 베이스라인으로 사용한다. 이 방식은 PPO에서 필요한 별도의 가치 네트워크(critic)를 대체하여 연산 자원을 절약한다. GRPO는 일반적으로 그룹 표준편차로 정규화하지만, 본 유도 과정에서는 평균 중심화(mean-centering)에 초점을 맞춘다.
구현 과제: 추론 불일치
훈련 모델과 완결 문장 생성에 사용되는 추론 엔진(vLLM 또는 SGLang 등) 간의 불일치는 중요한 실무적 문제다. 이론적 유도는 미분 대상인 분포 $p_\theta$에서 샘플이 추출된다고 가정한다. 그러나 실제에서는 수치 정밀도 차이 또는 비동기 가중치 업데이트로 인해 추론 엔진이 약간 다른 분포를 사용한다. 이는 점수 함수의 영평균(zero-mean) 특성을 깨뜨려 베이스라인 적용 시 그래디언트 추정에 편향을 유발할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.