AI Briefing

에이전트 실패지도

Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents

·2026.04.15 21:07

핵심 내용

VAKRA는 기업형 API·문서 작업에서 에이전트의 추론 실패를 드러낸다.

1 / 2

자세히 보기

VAKRA는 기업 환경을 모사한 tool-grounded executable benchmark로, 에이전트가 단순 질의응답이 아니라 실제 실행 흐름 속에서 얼마나 안정적으로 추론하고 행동하는지 평가한다.

핵심 규모는 다음과 같다.

  • 8,000+ 로컬 호스팅 API
  • 62개 도메인의 실제 DB
  • 자연어 tool-use 제약 아래 3~7단계의 복합 작업

벤치마크는 4개 능력 축으로 나뉜다.

  • Capability 1: API chaining using BI APIs

    • 2,077개 인스턴스, 54개 도메인
    • SLOT-BIRD / SEL-BIRD 도구를 사용
    • 1~12개 tool call을 연쇄적으로 이어야 정답 도출
    • 각 인스턴스는 get_data(tool_universe_id=...)로 데이터 소스를 먼저 초기화해야 함
  • Capability 2: Tool selection using dashboard APIs

    • 1,597개 인스턴스, 17개 도메인
    • REST-BIRD 기반의 도메인 특화 API 선택이 핵심
    • 도메인별 도구 수는 6~328개, 평균 116개
    • OpenAI API의 128개 tool 제한 때문에 shortlisting이 필요
  • Capability 3: Multi-hop reasoning using dashboard APIs

    • 869개 인스턴스, 38개 도메인
    • 질문당 1~5 hop의 논리적 추론 필요
  • Capability 4: Multi-hop, multi-source reasoning and policy adherence

    • 644개 인스턴스, 41개 도메인
    • API와 문서 검색을 함께 써야 하는 multi-source 문제 포함
    • 대화형 multi-turn 설정과 tool-usage policy 준수까지 요구
    • 예: API - RAG - API처럼 hop마다 허용된 소스를 맞춰야 함
    • 데이터 생성 시 필요한 정보가 한 소스에만 남도록 decontamination을 적용

요지는, 기존 벤치마크보다 한 단계 더 현실적인 환경에서 도구 선택, 다단계 추론, 정책 준수가 동시에 무너지는 지점을 보여준다는 점이다. 저자들은 다양한 모델이 VAKRA에서 전반적으로 낮은 성능을 보였다고 밝히며, 세부 태스크별 failure mode를 분석한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.