AI 에이전트 성능 저하 측정 벤치마크 AgingBench
Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems [R]
·2026.05.29 02:42
AI 에이전트의 장기 배포 시 성능 저하를 측정하는 AgingBench 벤치마크가 공개되었다.
AI 에이전트가 배포 후 시간이 지남에 따라 성능이 저하되는 현상을 측정하기 위한 새로운 벤치마크인 AgingBench가 공개되었다. 이 연구는 단일 작업 수행 능력이 아닌, 장기적인 배포 환경에서 에이전트가 어떻게 유지되는지를 중점적으로 다룬다.
주요 연구 결과는 다음과 같다:
- 모델 교체의 역설: Claude Code CLI 환경에서 백본 모델을 Sonnet 4.6에서 Opus 4.7로 교체했을 때, 오히려 PyTest 통과율이 평균 15% 하락했다.
- 메모리 상태의 진화: 성능 저하는 모델의 원천 능력 문제가 아니라, 장기 운용 과정에서의 메모리 압축, 간섭, 수정, 유지보수 충격 등 메모리 상태의 변화로 인해 발생하는 종단적(longitudinal) 효과다.
- 메모리 정책의 중요성: 메모리 정책은 에이전트의 수명(half-life)에 모델 교체보다 더 큰 영향(4.5배 차이)을 미치는 것으로 나타났다.
결론적으로, 장기 운용되는 에이전트 시스템에서는 단순히 최신 모델로 교체하는 것이 안전한 업그레이드 전략이 아닐 수 있으며, 메모리 관리 정책이 핵심적인 역할을 한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.