Eval 엔지니어링 스킬: 저장소 컨텍스트와 트레이스로 Eval 구축하기
LangChain이 저장소 구조와 실행 트레이스를 분석해 에이전트 평가(eval)를 자동 생성하는 'Eval Engineering Skill'을 출시했다.
Eval Engineering Skill은 코딩 에이전트가 저장소 컨텍스트와 실행 트레이스를 활용해 eval을 구축하도록 돕는 스킬이다. 저장소에서 프롬프트, 모델, 툴, 훅 등 에이전트 구조를 파악하고, langsmith-cli 같은 도구로 수집한 트레이스에서 실제 툴 호출 패턴을 분석한다.
단순 일괄 생성 대신 사용자 인터뷰 방식을 채택해 제안된 eval 방향에 대해 피드백을 받고 반복적으로 승인하는 구조다. 어떤 툴을 실제 실행할지, 비용 발생이나 프로덕션 쓰기가 필요한 툴은 시뮬레이션할지 등을 사용자가 결정한다.
최종 산출물은 Harbor 형식의 실행 가능한 eval 태스크다. 각 태스크는 다음 세 요소로 구성된다:
- Instruction: 에이전트에게 전달하는 태스크 설명
- Environment: 툴 설치 및 데이터 구성을 담은 Dockerfile
- Verifier: 태스크 완료 여부를 채점하는 검증기
검증기는 첫 번째 버전이 최종본이 되는 경우가 드물었다. eval 실행 후 에이전트 궤적과 검증기 궤적을 함께 분석하면 리워드 해킹(관련 없는 출처 과다 인용, 수행하지 않은 액션 주장 등)을 발견하고 태스크·환경·검증기를 개선할 수 있다.
chat-langchain 문서 Q&A 에이전트를 대상으로 검증했으며, 실제 트레이스에서 추출한 질문과 골든 답변 문자열·인용 문서 기반 검증기를 사용했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.