이질적 선호 정렬을 위한 개인화 Group Relative Policy Optimization
·2026.04.02 09:00
핵심 내용
P-GRPO는 그룹별 보상 이력으로 개인 선호를 분리해 GRPO의 편향을 줄인다.
자세히 보기
기존 LLM 정렬은 RLHF처럼 단일 전역 목표를 최적화하기 때문에 서로 다른 개인 선호를 충분히 반영하지 못한다. 특히 널리 쓰이는 GRPO는 그룹 내 샘플을 서로 교환 가능하다고 가정해, 개인화 상황에서는 서로 다른 사용자 보상 분포를 섞어 버리고 다수 선호에 학습이 쏠리는 문제가 생긴다.
이를 해결하기 위해 **P-GRPO (Personalized GRPO)**를 제안한다. 핵심은 advantage를 현재 배치의 통계로 정규화하지 않고, 선호 그룹별 보상 이력에 대해 정규화해 즉시 생성된 그룹에 대한 의존을 줄이는 데 있다.
이 방식은 서로 다른 선호 신호를 유지하면서도 대비 학습 신호를 보존해, 희소한 소수 선호가 사라지는 현상을 완화한다. 다양한 task 실험에서 P-GRPO는 표준 GRPO보다 더 빠르게 수렴하고 더 높은 reward를 달성해, 보상 이질성을 최적화 수준에서 다루는 것이 개인화 정렬의 핵심임을 보여준다.
- 문제: 하나의 전역 목표로는 다양한 사용자 선호를 제대로 반영하기 어렵다.
- 원인: GRPO의 그룹 정규화가 이질적인 보상 분포를 하나로 섞어 편향을 만든다.
- 해결: 선호 그룹별 보상 이력을 기준으로 advantage를 정규화하는 P-GRPO.
- 결과: 더 빠른 수렴, 더 높은 reward, 그리고 다양한 선호 신호의 더 나은 복원.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.