IBM, 산업용 AI 에이전트 벤치마크 공개
AssetOpsBench: Bridging the Gap Between AI Agent Benchmarks and Industrial Reality
·2026.01.21 15:25
핵심 내용
산업 현장의 복잡한 운영 환경을 평가하기 위한 AI 에이전트 벤치마크 AssetOpsBench가 공개되었다.
자세히 보기
IBM Research가 산업용 자산 수명 주기 관리(Asset Lifecycle Management)를 위해 설계된 새로운 AI 에이전트 벤치마크인 AssetOpsBench를 공개했다. 기존 벤치마크가 코딩이나 웹 탐색 등 개별 작업에 치중했다면, AssetOpsBench는 멀티 에이전트 간의 협업과 복잡한 산업 현장의 실패 모드를 평가하는 데 중점을 둔다.
이 벤치마크는 칠러(Chiller) 및 공기 조절 장치(AHU)와 같은 산업 자산 운영을 대상으로 하며, 다음과 같은 방대한 데이터를 포함한다:
- 230만 개의 센서 텔레메트리 데이터 포인트
- 140개 이상의 큐레이션된 시나리오 및 4개의 에이전트
- 4,200개의 작업 지시서(Work orders)
- 53개의 구조화된 실패 모드
평가는 작업 완료도, 검색 정확도, 결과 검증, 시퀀스 정확성, 명확성 및 근거 제시, 환각률 등 6가지 정성적 차원에서 이루어진다. 특히, 에이전트의 실패를 단순한 이진 결과로 보지 않고, TrajFM이라는 궤적 수준의 파이프라인을 통해 실패의 원인(데이터 불일치, 과도한 확신, 협업 결여 등)을 심층 분석하여 개발자에게 피드백을 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.