IBM, 산업용 AI 에이전트 벤치마크 공개
AssetOpsBench: Bridging the Gap Between AI Agent Benchmarks and Industrial Reality
·2026.01.21 15:25
산업 현장의 복잡한 운영 환경을 평가하기 위한 AI 에이전트 벤치마크 AssetOpsBench가 공개되었다.
IBM Research가 산업용 자산 수명 주기 관리(Asset Lifecycle Management)를 위해 설계된 새로운 AI 에이전트 벤치마크인 AssetOpsBench를 공개했다. 기존 벤치마크가 코딩이나 웹 탐색 등 개별 작업에 치중했다면, AssetOpsBench는 멀티 에이전트 간의 협업과 복잡한 산업 현장의 실패 모드를 평가하는 데 중점을 둔다.
이 벤치마크는 칠러(Chiller) 및 공기 조절 장치(AHU)와 같은 산업 자산 운영을 대상으로 하며, 다음과 같은 방대한 데이터를 포함한다:
- 230만 개의 센서 텔레메트리 데이터 포인트
- 140개 이상의 큐레이션된 시나리오 및 4개의 에이전트
- 4,200개의 작업 지시서(Work orders)
- 53개의 구조화된 실패 모드
평가는 작업 완료도, 검색 정확도, 결과 검증, 시퀀스 정확성, 명확성 및 근거 제시, 환각률 등 6가지 정성적 차원에서 이루어진다. 특히, 에이전트의 실패를 단순한 이진 결과로 보지 않고, TrajFM이라는 궤적 수준의 파이프라인을 통해 실패의 원인(데이터 불일치, 과도한 확신, 협업 결여 등)을 심층 분석하여 개발자에게 피드백을 제공한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.