추천
ITBench-AA: 기업 IT 에이전트 벤치마크 공개
ITBench-AA: Frontier Models Score Below 50% on the First Benchmark for Agentic Enterprise IT Tasks — by Artificial Analysis and IBM
·2026.05.28 02:20
핵심 내용
Artificial Analysis와 IBM이 기업 IT 에이전트 성능을 평가하는 새로운 벤치마크 ITBench-AA를 출시했다.
1 / 2
자세히 보기
Artificial Analysis와 IBM Software Innovation Lab이 에이전트 기반 기업 IT 작업, 특히 SRE(Site Reliability Engineering) 능력을 평가하는 새로운 벤치마크 ITBench-AA를 발표했다.
이 벤치마크는 Kubernetes 인시던트 대응을 다루며, 모델이 로그를 분석하고 의존성을 추적하여 복잡한 인프라 내에서 근본 원인을 식별해야 하는 고난도 작업을 포함한다.
주요 분석 결과:
- 프론티어 모델 성능: 모든 프론티어 모델이 50% 미만의 점수를 기록했다. 이는 에이전트 기반 IT 작업이 여전히 매우 어려운 과제임을 시사한다.
- 모델 순위: Claude Opus 4.7이 47%로 가장 높은 성능을 보였으며, GPT-5.5 (46%), Qwen3.7 Max (42%)가 뒤를 이었다.
- 오픈 웨이트 모델: **GLM-5.1 (Reasoning)**이 40%로 선두를 달렸으며, DeepSeek V4 Pro (38%)와 Gemma 4 31B (37%)가 그 뒤를 이었다.
- 효율성 문제: 단순히 많은 단계(Turn)를 거치는 것이 정확도 향상으로 이어지지는 않았다. 오히려 과도한 조사는 오탐(False Positive)을 유발하는 경향이 확인되었다.
향후 이 벤치마크는 FinOps 및 CISO 관련 작업으로 범위를 확장할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.