VPO: 다양성 학습으로 추론 성능 강화
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
·2026.05.23 03:01
VPO는 모델이 다양한 해법을 생성하도록 학습시켜 추론 시 검색 성능을 높이는 RL 알고리즘이다.
기존 LLM 사후 학습(Post-training)은 단일 스칼라 보상을 최적화하는 방식에 의존하여, 모델의 응답 분포가 단조로워지는 문제가 있습니다. 이는 추론 단계에서 다양한 경로를 탐색해야 하는 Inference-time search 성능을 저하시킵니다.
**Vector Policy Optimization (VPO)**는 보상을 벡터 값으로 처리하여 모델이 다양한 해법을 생성하도록 학습하는 새로운 강화학습(RL) 알고리즘입니다.
주요 특징은 다음과 같습니다:
- GRPO 대체 가능: GRPO의 어드밴티지 추정기(Advantage estimator)를 대체할 수 있는 드롭인(Drop-in) 방식입니다.
- 다양성 확보: 모델이 벡터 보상 공간 내에서 서로 다른 트레이드오프를 가진 솔루션들을 생성하도록 유도합니다.
- 검색 성능 우위: pass@k 및 best@k 지표에서 기존 스칼라 RL 모델을 능가하며, 검색 예산이 커질수록 성능 격차가 확대됩니다.
- 한계 극복: GRPO 모델이 해결하지 못하는 진화적 검색(Evolutionary search) 문제를 해결할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.