AI Briefing

VPO: 다양성 학습으로 추론 성능 강화

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

·2026.05.23 03:01

핵심 내용

VPO는 모델이 다양한 해법을 생성하도록 학습시켜 추론 시 검색 성능을 높이는 RL 알고리즘이다.

자세히 보기

기존 LLM 사후 학습(Post-training)은 단일 스칼라 보상을 최적화하는 방식에 의존하여, 모델의 응답 분포가 단조로워지는 문제가 있습니다. 이는 추론 단계에서 다양한 경로를 탐색해야 하는 Inference-time search 성능을 저하시킵니다.

**Vector Policy Optimization (VPO)**는 보상을 벡터 값으로 처리하여 모델이 다양한 해법을 생성하도록 학습하는 새로운 강화학습(RL) 알고리즘입니다.

주요 특징은 다음과 같습니다:

  • GRPO 대체 가능: GRPO의 어드밴티지 추정기(Advantage estimator)를 대체할 수 있는 드롭인(Drop-in) 방식입니다.
  • 다양성 확보: 모델이 벡터 보상 공간 내에서 서로 다른 트레이드오프를 가진 솔루션들을 생성하도록 유도합니다.
  • 검색 성능 우위: pass@k 및 best@k 지표에서 기존 스칼라 RL 모델을 능가하며, 검색 예산이 커질수록 성능 격차가 확대됩니다.
  • 한계 극복: GRPO 모델이 해결하지 못하는 진화적 검색(Evolutionary search) 문제를 해결할 수 있습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.