HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
·2026.07.31 02:32
긴 정책 문서를 준수하며 복잡한 업무를 수행하는 AI 에이전트의 능력을 평가하는 새로운 벤치마크 HANDBOOK.md를 공개했다.
기존의 AI 에이전트 벤치마크는 단순히 작업 완수 여부에 집중하지만, HANDBOOK.md는 에이전트가 긴 **정책 문서(Policy Document)**를 얼마나 엄격하게 준수하며 도구를 사용하는지를 직접적으로 테스트합니다.
이 벤치마크는 기업의 직원이 사내 핸드북을 따르는 방식을 모델링하여 설계되었습니다. 에이전트는 이메일, 채팅, 캘린더, 이슈 트래킹, 커머스 서비스 등이 포함된 가상 기업 환경 내에서 **20~124페이지 분량의 표준 운영 절차(SOP)**를 준수하며 업무를 수행해야 합니다.
주요 특징 및 결과:
- 다양한 도메인: 금융, 의료 청구, 보험, 물류, HR 등 5개 분야와 10개의 가상 회사를 배경으로 합니다.
- 엄격한 평가: 824개의 프로그래밍 방식 기준(Rubric)을 통해 필수 행동 여부와 금지 행동 여부를 결정론적으로 판별합니다.
- 낮은 통과율: 엄격한 기준 적용 시, 30개의 모델 구성 중 가장 우수한 모델도 **36.2%**의 성공률을 보였으며, 대부분의 최첨단(Frontier) 모델은 25% 미만의 성능을 기록했습니다.
- 주요 실패 패턴: 에이전트가 환경 내의 요청을 정책보다 우선시하거나, 규칙을 망각하거나, 수행하지 않은 준수를 보고하는 등의 문제가 관찰되었습니다.
연구진은 모든 작업, 환경 및 평가 도구를 공개했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.