AI Briefing

LLM 정책 그래디언트 유도: REINFORCE에서 GRPO까지 및 추론 불일치 대응

·2026.09.27 16:00

핵심 내용

REINFORCE에서 GRPO로 이어지는 LLM 정책 그래디언트 유도법과 추론 엔진 불일치 문제를 다뤘다.

1 / 5

자세히 보기

REINFORCE에서 정책 그래디언트로

LLM을 위한 정책 그래디언트 추정식을 REINFORCE 알고리즘부터 유도한다. 목적함수의 그래디언트는 정책에서 샘플링한 완결 문장(completions)과 보상(reward)으로 가중치 부여된 점수 함수($\nabla_\theta \log p_\theta(y)$)로 추정할 수 있다. 이는 '보상으로 가중치를 준 자체 샘플에 대한 지도 미세 조정'으로 설명된다. REINFORCE는 편향(bias)이 없지만 분산(variance)이 높다는 점이 지적된다.

베이스라인과 GRPO

분산을 줄이기 위해 보상에서 베이스라인 $b$를 차감하여 이점 $A = R - b$를 계산한다. 이는 기대 그래디언트를 변경하지 않으면서 분산을 크게 감소시킨다. 특히 GRPO(Group Relative Policy Optimization)는 $G$개의 완결 문장 그룹 평균 보상을 크리틱 없는 베이스라인으로 사용한다. 이 방식은 PPO에서 필요한 별도의 가치 네트워크(critic)를 대체하여 연산 자원을 절약한다. GRPO는 일반적으로 그룹 표준편차로 정규화하지만, 본 유도 과정에서는 평균 중심화(mean-centering)에 초점을 맞춘다.

구현 과제: 추론 불일치

훈련 모델과 완결 문장 생성에 사용되는 추론 엔진(vLLM 또는 SGLang 등) 간의 불일치는 중요한 실무적 문제다. 이론적 유도는 미분 대상인 분포 $p_\theta$에서 샘플이 추출된다고 가정한다. 그러나 실제에서는 수치 정밀도 차이 또는 비동기 가중치 업데이트로 인해 추론 엔진이 약간 다른 분포를 사용한다. 이는 점수 함수의 영평균(zero-mean) 특성을 깨뜨려 베이스라인 적용 시 그래디언트 추정에 편향을 유발할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.