AI Briefing

테스트는 통과했지만 에이전트는 고장났다

All Our Tests Passed. The Agent Was Still Broken.

·2026.04.29 23:49

핵심 내용

Agentic COBOL로 에이전트 툴 라우팅을 검증하는 방법을 제시했다.

자세히 보기

LLM 에이전트의 실패 지점은 코드가 아니라 툴 라우팅에 있었다.

  • CI와 함수 단위 테스트는 모두 통과했지만, 실제 에이전트는 이미 설치된 플러그인을 또 설치하라고 안내하는 식의 silent misroute를 냈다.
  • 저자는 이를 Agentic COBOL이라 부르며, 실제 자연어 프롬프트를 실제 런타임에 넣고 올바른 tool_use가 발생하는지 채점하는 방식을 제안했다.
  • Python mock, SDK 경계 테스트, 그리고 RAGAS·DeepEval·LangSmith류의 output-quality 평가는 이 문제를 못 잡는다. 검증 대상은 코드 경로가 아니라 LLM + tool catalog + description text의 조합이기 때문이다.
  • 각 실행은 실제 LLM 호출이라 10~30초가 걸리고 API 비용과 비결정성을 동반한다.
  • 구현은 30개 프롬프트 JSON 코퍼스, 런타임별 expected route, Claude Code용 스트리밍 JSON 파서가 붙은 러너로 구성됐다. 이번 사이클에서는 Claude Code를 Linux x86에서 두 consult-provider 모드(Together AI cloud, local GPU)로 각각 3회씩 돌려 180개 routing decision을 검사했고, 실패는 0건이었다.
  • v13 harness는 30 prompts × 3 runtimes × 3 hosts × N model combos × N consult-provider modes의 매트릭스로 확장됐고, 인간 언어가 정확성에 포함된 시스템은 그 언어층까지 포함해 테스트해야 한다는 결론으로 이어졌다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.