PORTool: 다중 도구 통합 추론을 위한 보상 트리 기반 중요도 인식 정책 최적화
·2026.05.04 09:00
PORTool이 단계별 중요도 추정으로 정확도와 도구 호출 효율을 함께 개선했다.
PORTool은 결과만으로 보상을 주는 학습에서 생기는 credit assignment 문제를 줄이기 위해 보상 트리(rewarded rollout tree) 를 사용한다. 공통 접두사를 공유한 뒤 분기하는 구조라서, 같은 문맥에서 서로 다른 도구 사용 결정을 직접 비교할 수 있다.
단계별 중요도는 두 신호로 추정한다.
- 해당 단계의 자손 경로가 최종 정답에 도달할 수 있는지 보는 correctness-dominant signal
- 그 단계의 tool call 이 실제로 성공했는지를 반영하는 보조 항목
이렇게 얻은 단계별 중요도로 정책을 갱신해, 더 효율적인 도구 호출과 추론을 유도한다. 국소적인 분기 비교와 전체 경로 품질을 함께 반영해, 불필요한 호출을 줄이면서도 정답률을 높이는 방향이다.
실험에서는 최종 답변 정확도가 향상되고 도구 호출 단계 수는 줄었으며, ablation study에서도 제안한 단계별 중요도 추정의 견고함을 확인했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.