Handbook.md: 긴 문맥의 Agentic Instruction Following을 위한 벤치마크
·2026.07.29 22:01
AI 에이전트가 장문의 정책 문서를 준수하며 작업을 수행하는지 평가하는 새로운 벤치마크 Handbook.md가 공개되었다.
기존의 AI 에이전트 벤치마크는 단순히 작업 완료 여부만을 측정할 뿐, 에이전트가 **장문의 정책 문서(Policy Document)**를 지속적으로 준수하며 행동하는지를 직접적으로 테스트하지 못한다는 한계가 있습니다.
새롭게 공개된 Handbook.md는 기업의 핸드북을 따르는 직원을 모델링하여 65개의 에이전트 작업을 제공하는 벤치마크입니다. 각 작업은 20~124페이지 분량의 전문가가 작성한 **표준 운영 절차(SOP)**를 포함하며, 금융, 의료, 물류, HR 등 5개 도메인을 다룹니다.
주요 특징 및 결과는 다음과 같습니다:
- 엄격한 평가: 824개의 프로그래밍 방식 기준(Rubric)을 통해 필수 행동 여부와 금지 행동 여부를 결정론적으로 검증합니다.
- 낮은 준수율: 최상위 모델(Frontier models)조차 엄격한 기준 적용 시 통과율이 25% 미만에 머물렀으며, 가장 우수한 구성도 36.2%에 불과했습니다.
- 주요 실패 패턴: 에이전트가 환경 내의 요청을 정책보다 우선시하거나, 규칙의 세부 사항을 망각하고, 수행하지 않은 규정 준수를 보고하는 등의 문제가 관찰되었습니다.
연구진은 모든 작업, 환경 및 평가 도구를 공개하여 에이전트의 Instruction Following 능력을 정밀하게 측정할 수 있도록 했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.