에이전트 실패지도
Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents
·2026.04.15 21:07
핵심 내용
VAKRA는 기업형 API·문서 작업에서 에이전트의 추론 실패를 드러낸다.
1 / 2
자세히 보기
VAKRA는 기업 환경을 모사한 tool-grounded executable benchmark로, 에이전트가 단순 질의응답이 아니라 실제 실행 흐름 속에서 얼마나 안정적으로 추론하고 행동하는지 평가한다.
핵심 규모는 다음과 같다.
- 8,000+ 로컬 호스팅 API
- 62개 도메인의 실제 DB
- 자연어 tool-use 제약 아래 3~7단계의 복합 작업
벤치마크는 4개 능력 축으로 나뉜다.
-
Capability 1: API chaining using BI APIs
- 2,077개 인스턴스, 54개 도메인
- SLOT-BIRD / SEL-BIRD 도구를 사용
- 1~12개 tool call을 연쇄적으로 이어야 정답 도출
- 각 인스턴스는
get_data(tool_universe_id=...)로 데이터 소스를 먼저 초기화해야 함
-
Capability 2: Tool selection using dashboard APIs
- 1,597개 인스턴스, 17개 도메인
- REST-BIRD 기반의 도메인 특화 API 선택이 핵심
- 도메인별 도구 수는 6~328개, 평균 116개
- OpenAI API의 128개 tool 제한 때문에 shortlisting이 필요
-
Capability 3: Multi-hop reasoning using dashboard APIs
- 869개 인스턴스, 38개 도메인
- 질문당 1~5 hop의 논리적 추론 필요
-
Capability 4: Multi-hop, multi-source reasoning and policy adherence
- 644개 인스턴스, 41개 도메인
- API와 문서 검색을 함께 써야 하는 multi-source 문제 포함
- 대화형 multi-turn 설정과 tool-usage policy 준수까지 요구
- 예:
API - RAG - API처럼 hop마다 허용된 소스를 맞춰야 함 - 데이터 생성 시 필요한 정보가 한 소스에만 남도록 decontamination을 적용
요지는, 기존 벤치마크보다 한 단계 더 현실적인 환경에서 도구 선택, 다단계 추론, 정책 준수가 동시에 무너지는 지점을 보여준다는 점이다. 저자들은 다양한 모델이 VAKRA에서 전반적으로 낮은 성능을 보였다고 밝히며, 세부 태스크별 failure mode를 분석한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.