CANTANTE, 에이전트 최적화
CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution [R]
·2026.05.20 20:43
CANTANTE는 credit assignment로 멀티에이전트 프롬프트 최적화를 개선했다.
LLM 기반 multi-agent system의 핵심 병목인 credit assignment를 풀어, 각 에이전트의 공헌도를 전역 점수에서 분해해 학습시키는 접근을 제시했다.
- 로컬 최적화기가 프롬프트 같은 설정안을 제안하고, 같은 질의에 대한 여러 rollout을 비교해 추적 가능한 reasoning trace와 시스템 점수를 수집한다.
- attributer가 rollout들을 대조해 각 에이전트에 credit을 부여하고, 그 신호를 다시 로컬 최적화기에 전달한다.
- 실험에서는 기존 CAPO prompt optimizer를 사용했다.
평가 대상은 MBPP, GSM8K, HotpotQA였고, DSPy-solutions GEPA와 MIPROv2보다 좋은 평균 순위를 기록했다.
또한 MBPP에서 +18.9점, GSM8K에서 +12.5점의 개선을 보였고, 비최적화 프롬프트 대비 추론 시간 비용을 유지했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.