AI Briefing

Deep Agents를 위한 평가(evals) 구축 방법

·2026.03.27 00:18

에이전트의 정확도와 신뢰성을 높이기 위해 실제 운영 환경의 동작을 반영한 타겟팅된 평가 체계를 구축해야 한다.

Deep Agents의 성능을 개선하기 위해 평가(evals)는 에이전트의 동작을 정의하고 형성하는 핵심 요소다. 단순히 수많은 테스트를 추가하는 것은 운영 환경의 실제 동작을 반영하지 못하는 착시를 일으킬 수 있으므로, 목적이 분명한 타겟팅된 평가를 구축하는 것이 무엇보다 중요하다.

효과적인 평가 구축을 위해 다음과 같은 프로세스를 따른다:

  • 에이전트가 수행해야 할 핵심 동작을 결정하고, 이를 검증할 수 있는 맞춤형 평가를 큐레이션한다.
  • 각 평가에 측정 방식을 설명하는 docstring을 추가하고, tool_use와 같은 태그를 부여해 그룹화한다.
  • LangSmith의 트레이스(trace)를 검토하여 실패 모드를 분석하고 평가 범위를 지속적으로 업데이트한다.

데이터는 자체 에이전트를 직접 사용하는 dogfooding, Terminal Bench 2.0이나 BFCL 같은 외부 벤치마크 활용, 그리고 중요 동작에 대한 수동 테스트 작성을 통해 확보한다.

특히 SDK의 유닛/통합 테스트와 모델의 역량을 측정하는 **모델 역량 평가(model capability evals)**를 엄격히 분리해야 한다. 이를 통해 불필요한 신호를 제거하고 실제 모델 성능 개선에 집중할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.