AI Briefing

추천ITBench-AA: 기업 IT 에이전트 벤치마크 공개

ITBench-AA: Frontier Models Score Below 50% on the First Benchmark for Agentic Enterprise IT Tasks — by Artificial Analysis and IBM

·2026.05.28 02:20

Artificial Analysis와 IBM이 기업 IT 에이전트 성능을 평가하는 새로운 벤치마크 ITBench-AA를 출시했다.

Artificial Analysis와 IBM Software Innovation Lab이 에이전트 기반 기업 IT 작업, 특히 SRE(Site Reliability Engineering) 능력을 평가하는 새로운 벤치마크 ITBench-AA를 발표했다.

이 벤치마크는 Kubernetes 인시던트 대응을 다루며, 모델이 로그를 분석하고 의존성을 추적하여 복잡한 인프라 내에서 근본 원인을 식별해야 하는 고난도 작업을 포함한다.

주요 분석 결과:

  • 프론티어 모델 성능: 모든 프론티어 모델이 50% 미만의 점수를 기록했다. 이는 에이전트 기반 IT 작업이 여전히 매우 어려운 과제임을 시사한다.
  • 모델 순위: Claude Opus 4.7이 47%로 가장 높은 성능을 보였으며, GPT-5.5 (46%), Qwen3.7 Max (42%)가 뒤를 이었다.
  • 오픈 웨이트 모델: **GLM-5.1 (Reasoning)**이 40%로 선두를 달렸으며, DeepSeek V4 Pro (38%)와 Gemma 4 31B (37%)가 그 뒤를 이었다.
  • 효율성 문제: 단순히 많은 단계(Turn)를 거치는 것이 정확도 향상으로 이어지지는 않았다. 오히려 과도한 조사는 오탐(False Positive)을 유발하는 경향이 확인되었다.

향후 이 벤치마크는 FinOps 및 CISO 관련 작업으로 범위를 확장할 계획이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.