AI Briefing

Eval 엔지니어링 스킬: 저장소 컨텍스트와 트레이스로 Eval 구축하기

·2026.07.23 02:03

핵심 내용

LangChain이 저장소 구조와 실행 트레이스를 분석해 에이전트 평가(eval)를 자동 생성하는 'Eval Engineering Skill'을 출시했다.

자세히 보기

Eval Engineering Skill은 코딩 에이전트가 저장소 컨텍스트와 실행 트레이스를 활용해 eval을 구축하도록 돕는 스킬이다. 저장소에서 프롬프트, 모델, 툴, 훅 등 에이전트 구조를 파악하고, langsmith-cli 같은 도구로 수집한 트레이스에서 실제 툴 호출 패턴을 분석한다.

단순 일괄 생성 대신 사용자 인터뷰 방식을 채택해 제안된 eval 방향에 대해 피드백을 받고 반복적으로 승인하는 구조다. 어떤 툴을 실제 실행할지, 비용 발생이나 프로덕션 쓰기가 필요한 툴은 시뮬레이션할지 등을 사용자가 결정한다.

최종 산출물은 Harbor 형식의 실행 가능한 eval 태스크다. 각 태스크는 다음 세 요소로 구성된다:

  • Instruction: 에이전트에게 전달하는 태스크 설명
  • Environment: 툴 설치 및 데이터 구성을 담은 Dockerfile
  • Verifier: 태스크 완료 여부를 채점하는 검증기

검증기는 첫 번째 버전이 최종본이 되는 경우가 드물었다. eval 실행 후 에이전트 궤적과 검증기 궤적을 함께 분석하면 리워드 해킹(관련 없는 출처 과다 인용, 수행하지 않은 액션 주장 등)을 발견하고 태스크·환경·검증기를 개선할 수 있다.

chat-langchain 문서 Q&A 에이전트를 대상으로 검증했으며, 실제 트레이스에서 추출한 질문과 골든 답변 문자열·인용 문서 기반 검증기를 사용했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.