IBM, AI 에이전트 일관성 지표 'Consistency Gap' 공개
Your Agent Aced the Task. Will It Do It Again?
핵심 내용
IBM Research가 AI 에이전트의 반복 실행 일관성을 측정하는 'Consistency Gap' 지표를 정의하고 이를 개선하는 도구를 공개했다.
자세히 보기
IBM Research가 AI 에이전트의 신뢰성 문제를 해결하기 위해 새로운 평가 지표인 Consistency Gap을 정의하고, 이를 개선하는 Consistency Analyzer 도구를 공개했다.
Consistency Gap의 정의와 문제
기존의 Mean@k(평균 통과율)는 에이전트의 평균 성능은 잘 나타내지만, 동일 작업을 반복했을 때의 실패 가능성을 간과한다. IBM은 이를 보완하기 위해 Pass^k(k회 모두 성공한 비율)를 도입하고, Mean@k와 Pass^k의 차이를 Consistency Gap으로 명명했다.
GPT-4.1 기반 ReAct 에이전트를 AppWorld 테스트에서 5회 반복 실행한 결과:
- Mean@5: 77.4%
- Pass^5: 53.0%
- Consistency Gap: 24.4포인트
이는 모델의 능력(capability) 부족이 아니라, 의사결정 분포의 평탄함(flatness)으로 인한 비일관성(inconsistency) 문제임을 시사한다.
Consistency Analyzer 및 개선 효과
제안된 도구는 기존 ALTK-Evolve 파이프라인을 기반으로 하며, Ground Truth 없이 단일 궤적(trajectory)의 각 결정 단계에서 k회 재샘플링(k=5)을 수행하여 불안정한 결정점을 식별한다.
- 작동 방식: 각 결정 단계에서 5개의 completion을 요청하여 출력 변동성을 측정하고, 불안정한 단계를 타겟팅한 가이드라인을 생성한다.
- 개선 결과: 가이드라인 적용 시 Consistency Gap이 24.4pp에서 12.0pp로 절반 감소했다.
- 성능 향상: Aggregate Pass^5는 53.0%에서 **69.0%**로 상승했으며, Mean@5는 하락하지 않고 유지되거나 소폭 향상(77.4% -> 81.0%)되었다.
- 일반화: 유사 태스크 및 약한 모델(gpt-oss-120b)에서도 일관성 개선 효과가 확인되어, 특정 궤적 암기가 아닌 재사용 가능한 패턴 교정임을 입증했다.
실무적 시사점
에이전트 배포 시 Mean@k와 함께 Pass^k를 보고하고, 난이도가 높은 작업일수록 일관성 격차가 커짐을 인지해야 한다. IBM은 더 큰 모델 사용보다 일관성 개선이 우선되며, 진단 과정은 프로덕션 트래픽에서도 추가 LLM 호출 1회로 수행 가능하다고 강조했다. 관련 코드는 GitHub(ALTK-Evolve)와 arXiv(2609.08832)에서 확인할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.