Reinforced Agent: 도구 호출 에이전트를 위한 추론 시점 피드백
·2026.05.01 09:00
도구 호출 에이전트에 추론 시점 검토를 넣어 실행 전 오류를 줄였다.
Reinforced Agent는 도구 호출 에이전트의 평가를 사후 점검에서 실행 중 검토로 옮긴다. 검토 에이전트가 주 에이전트의 예비 도구 호출을 실행 전에 확인해, 도구 선택, 파라미터 정확도, 스코프 인식 오류를 바로잡도록 설계했다.
핵심은 주 에이전트와 검토 에이전트를 분리해 추론 루프 안에서 오류를 잡아내는 것이다. 다만 검토 과정이 새 오류를 만들 수도 있어, 저자들은 그 효용과 부작용을 함께 재는 Helpfulness-Harmfulness 지표를 제안했다.
- Helpfulness: 주 에이전트의 오류 중 피드백이 바로잡은 비율
- Harmfulness: 원래 정답이던 응답 중 피드백이 망가뜨린 비율
BFCL(단일 턴)과 τ2-Bench(상태를 유지하는 멀티 턴 시나리오)에서 평가한 결과, 비관련성 탐지는 +5.5%, 멀티 턴 작업은 +7.1% 개선됐다. 검토 모델 선택도 중요해 o3-mini는 3:1의 이득-위험 비율을 보였고, GPT-4o는 2.1:1에 그쳤다. GEPA 기반 자동 프롬프트 최적화는 추가로 **+1.5~2.8%**를 더했으며, 주 에이전트를 다시 학습시키지 않고도 검토 모델과 프롬프트를 개선할 수 있음을 보여줬다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.