AI Briefing

에이전트 노화 측정, AgingBench 공개

Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems [R]

·2026.05.29 02:44

배포된 AI 에이전트가 시간이 지남에 따라 성능이 저하되는 현상을 측정하는 AgingBench 벤치마크가 공개되었다.

AI 에이전트가 배포 후 시간이 지남에 따라 성능이 저하되는 '노화(Aging)' 현상을 연구하고 측정하는 새로운 벤치마크, AgingBench가 공개되었다.

연구에 따르면, Claude Code CLI 환경에서 백본 모델을 Sonnet 4.6에서 Opus 4.7로 교체했을 때 PyTest 통과율이 약 15% 감소하는 결과가 나타났다. 이는 모델의 기초 역량이 더 높음에도 불구하고 성능이 떨어지는 역설적인 상황을 보여준다.

이러한 성능 저하는 모델 자체의 능력 부족이 아닌, 장기적인 운영 과정에서 발생하는 종단적(longitudinal) 효과로 분석된다. 주요 원인은 다음과 같다:

  • 메모리 상태의 변화: 세션이 반복되면서 발생하는 메모리 압축, 간섭, 수정 및 유지 관리 충격(maintenance shocks).
  • 메모리 정책의 중요성: 실험 결과, 모델 교체보다 메모리 정책이 에이전트의 수명(half-life)에 미치는 영향이 약 4.5배 더 컸다.

결론적으로, 장기적으로 운영되는 에이전트 시스템을 구축할 때는 단순히 최신 모델로 교체하는 것이 항상 안전한 업그레이드 전략이 아닐 수 있으며, 메모리 관리 정책이 핵심적인 역할을 한다는 점을 시사한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.