AI Briefing

IBM, AI 에이전트 일관성 지표 'Consistency Gap' 공개

Your Agent Aced the Task. Will It Do It Again?

·2026.09.16 01:00

핵심 내용

IBM Research가 AI 에이전트의 반복 실행 일관성을 측정하는 'Consistency Gap' 지표를 정의하고 이를 개선하는 도구를 공개했다.

1 / 5

자세히 보기

IBM Research가 AI 에이전트의 신뢰성 문제를 해결하기 위해 새로운 평가 지표인 Consistency Gap을 정의하고, 이를 개선하는 Consistency Analyzer 도구를 공개했다.

Consistency Gap의 정의와 문제

기존의 Mean@k(평균 통과율)는 에이전트의 평균 성능은 잘 나타내지만, 동일 작업을 반복했을 때의 실패 가능성을 간과한다. IBM은 이를 보완하기 위해 Pass^k(k회 모두 성공한 비율)를 도입하고, Mean@k와 Pass^k의 차이를 Consistency Gap으로 명명했다.

GPT-4.1 기반 ReAct 에이전트를 AppWorld 테스트에서 5회 반복 실행한 결과:

  • Mean@5: 77.4%
  • Pass^5: 53.0%
  • Consistency Gap: 24.4포인트

이는 모델의 능력(capability) 부족이 아니라, 의사결정 분포의 평탄함(flatness)으로 인한 비일관성(inconsistency) 문제임을 시사한다.

Consistency Analyzer 및 개선 효과

제안된 도구는 기존 ALTK-Evolve 파이프라인을 기반으로 하며, Ground Truth 없이 단일 궤적(trajectory)의 각 결정 단계에서 k회 재샘플링(k=5)을 수행하여 불안정한 결정점을 식별한다.

  • 작동 방식: 각 결정 단계에서 5개의 completion을 요청하여 출력 변동성을 측정하고, 불안정한 단계를 타겟팅한 가이드라인을 생성한다.
  • 개선 결과: 가이드라인 적용 시 Consistency Gap이 24.4pp에서 12.0pp로 절반 감소했다.
  • 성능 향상: Aggregate Pass^5는 53.0%에서 **69.0%**로 상승했으며, Mean@5는 하락하지 않고 유지되거나 소폭 향상(77.4% -> 81.0%)되었다.
  • 일반화: 유사 태스크 및 약한 모델(gpt-oss-120b)에서도 일관성 개선 효과가 확인되어, 특정 궤적 암기가 아닌 재사용 가능한 패턴 교정임을 입증했다.

실무적 시사점

에이전트 배포 시 Mean@k와 함께 Pass^k를 보고하고, 난이도가 높은 작업일수록 일관성 격차가 커짐을 인지해야 한다. IBM은 더 큰 모델 사용보다 일관성 개선이 우선되며, 진단 과정은 프로덕션 트래픽에서도 추가 LLM 호출 1회로 수행 가능하다고 강조했다. 관련 코드는 GitHub(ALTK-Evolve)와 arXiv(2609.08832)에서 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.