AI Briefing

Deep Agents 벤치마크 방법론

·2026.07.24 02:56

LangChain이 오픈소스 에이전트 하네스 Deep Agents의 벤치마크 프레임워크를 공개했다.

Deep Agents 개발 과정에서 프롬프트 설계, 툴 선택, 미들웨어 구성 등 다양한 결정을 내려야 하는데, 이를 뒷받침할 견고한 평가 체계가 필요했다. 기존의 유닛 테스트 방식에서 벗어나 엔드투엔드 평가 중심으로 전환했으며, 평가 실행기로 Harbor 프레임워크를 채택했다.

Harbor는 에이전트, 데이터셋, 샌드박스 세 가지를 입력받아 평가를 수행한다. 각 태스크는 Dockerfile 기반 환경, 마크다운 지시문, 평가 스크립트(test.sh)로 구성된다. 단순 LLM 평가와 달리 에이전트가 실행되는 환경 자체가 중요하며, 최종 응답뿐 아니라 생성된 아티팩트까지 스크립트로 채점한다.

현재 세 가지 벤치마크를 운영 중이다:

  • Harbor-Index: 54개 벤치마크에서 추린 82개 태스크, 소프트웨어 엔지니어링·검색·데이터 분석 등 포괄
  • τ³-bench: 멀티턴 대화 평가, 30개 태스크
  • ContextBench: 검색·조합 능력 평가, 30개 태스크

실용적인 운영 원칙도 공유했다. 비결정적 특성 때문에 각 태스크를 여러 번 실행하고, 빠른 반복을 위해 전체 대비 8배 빠르고 6배 저렴한 'lite' 벤치마크를 별도 유지한다. 특정 하네스 동작을 검증하는 결정론적 유닛 테스트 suite도 병행한다.

이 체계를 활용해 Deep Agents 0.7 릴리스를 준비 중이며, todo-list 미들웨어 제거와 시스템 프롬프트 간소화를 검토하고 있다. 벤치마크 결과, 시스템 프롬프트 축소 시 Harbor-Index에서 성능이 향상되는 것을 확인했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.