AI Briefing

ProVer, GRPO 크레딧 할당 개선으로 LLM 에이전트 성능 9.91% 향상

·2026.10.02 23:36

핵심 내용

ProVer가 GRPO의 크레딧 할당 문제를 해결해 에이전트 작업에서 최대 9.91%의 성능 향상을 달성했다.

자세히 보기

GRPO의 균일한 이점 할당 문제 해결

Group Relative Policy Optimization(GRPO)은 LLM 에이전트 학습에 유망한 방법이지만, 크레딧 할당 문제가 있다. 궤적 수준의 이점을 모든 정책 토큰에 균일하게 할당하여 중요한 결정과 무관한 결정을 구분하지 못하며, 성공에 기여한 중간 단계를 파악하기 어렵다.

ProVer 프레임워크

이 문제를 해결하기 위해 연구자들은 ProVer를 도입했다. 잠재적으로 중요한 결정을 대상으로 세분화된 크레딧 할당을 수행한다.

  • 세그먼트 제안: 에이전트 판정자가 성공과 실패 궤적을 비교하여 결과 차이를 유발한 세그먼트를 식별한다.
  • 검증: 판정자를 직접 신뢰하는 대신, 현재 정책을 사용한 반사실 롤아웃으로 인과적 영향을 추정하여 세그먼트의 중요성을 검증한다.
  • 이점 업데이트: 검증된 인과적 크레딧을 GRPO 이점 계산에 통합하여 모델이 핵심 결정 지점에 학습을 집중하도록 한다.

성능 및 효율성

ALFWorld와 WebShop 벤치마크 실험에서 ProVer는 표준 GRPO 및 기타 기준선을 능가했다. Qwen3.5-2B에서 성공률 9.91%, Qwen3.5-4B에서 7.12%의 상대적 개선율을 기록했다. 또한 더 작은 판정자 모델을 사용해도 성능 향상이 유지되어, 검증 메커니즘이 노이즈가 있거나 잘못된 세그먼트 제안을 효과적으로 걸러냄을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.