마이크로소프트, 에이전트 신뢰성 벤치마크 ThinkingBox 공개
ThinkingBox: Solving an agent task once vs. solving it 20/20: 507 stateful workflows graded on terminal database state [R]
핵심 내용
마이크로소프트가 공개한 ThinkingBox 벤치마크 결과, 높은 pass@20 점수가 일관된 작업 완성을 보장하지 않는 것으로 나타났다.
자세히 보기
마이크로소프트가 ThinkingBox 벤치마크를 공개했다. 이 벤치마크는 리테일, 여행/호스피탈리티, 자동차 보험, 네오뱅크 내부 IT, 컨설팅 IT/HR 등 5개 도메인의 507개 정책 기반 비즈니스 워크플로우로 구성된다. 에이전트 신뢰성 평가를 위해 각 태스크를 클린 백엔드 상태에서 20회 실행하며, 모델당 총 10,140회의 트라이얼을 수행한다.
신뢰성 관련 주요 발견
에이전트가 태스크를 한 번이라도 해결하는 능력(pass@20)과 일관되게 해결하는 능력(all-20) 사이에 큰 격차가 존재한다.
- Kimi-K3는 **93.89%**의 태스크를 한 번 이상 해결해 가장 높은 커버리지를 기록했으나, 20회 모두 성공한 비율은 **13.41%**에 그쳤다.
- Claude Opus 5는 **79.09%**의 태스크를 한 번 이상 해결했으며, 20회 모두 성공한 비율은 **47.53%**로 더 높은 반복성을 보였다.
- Qwen3.8-27B는 **89.35%**의 태스크를 한 번 이상 해결했으나, 일관된 성공률은 **7.50%**였다.
실패 분석
121,680개의 유효 트라이얼에 대한 사후 분석 결과, 실패한 시도 중 **67.24%**가 도구 오류 없이 정상적으로 종료되어 기존 완료 지표로는 성공으로 잘못 판단될 수 있었다. 이러한 정상 종료 실패 사례에서 상태 체크가 식별한 주요 실패 유형은 다음과 같다(범주 간 중복 있음).
- 잘못된 필드 값: 77.61%
- 의도치 않은 추가 효과: 43.30%
- 필수 효과 누락: 25.36%
이용 가능 여부
벤치마크, 코드, 데이터셋은 GitHub와 Hugging Face에서 공개된다. 개발자는 HF OpenEnv를 통해 507개 태스크에 대해 자체 모델을 평가할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.