LangSmith로 음성 에이전트를 평가하는 방법
LangSmith는 음성 에이전트를 실행, 결과, 사용자 경험 측면에서 평가하도록 지원한다.
음성 에이전트는 자연스럽게 대화하고 사용자의 문제를 해결하는 동시에, 설계된 비즈니스 목표까지 달성해야 한다. 이를 평가하려면 단순한 대화 transcript를 넘어 전체 trace, 녹음, 도구 활동을 함께 살펴봐야 한다.
평가 기준은 세 가지로 나뉜다.
- 실행(Execution): 에이전트가 지침과 정책을 따랐는지 확인한다.
- 결과(Outcome): 상호작용이 의도한 목표를 달성했는지 평가한다.
- 경험(Experience): 통화가 자연스럽고 매끄러웠는지 살핀다.
실행 평가에서는 올바른 도구를 정확한 인자와 순서로 호출했는지, 개인정보·고지·동의 정책을 지켰는지, 필요한 정보를 수집하고 확인했는지 점검한다. 최종 답변뿐 아니라 에이전트가 그 답변에 도달한 과정도 평가 대상이다.
명확한 규칙으로 정의할 수 있는 요구사항에는 code evaluator가 적합하다. 예를 들어 check_availability를 book_appointment보다 먼저 호출했는지, 예약 도구에 확인된 날짜·시간·타임존이 전달됐는지, 필수 고지가 transcript에 포함됐는지 등을 빠르고 저렴하게 검사할 수 있다.
자연어의 의미를 판단해야 하는 요구사항에는 LLM judge를 활용한다. 정책 준수 여부, 답변의 정확성, 필요한 정보 요청 여부, 다음 단계에 대한 설명의 명확성, 모호한 요청에 대한 적절한 추가 질문 등을 평가할 수 있다.
LLM judge는 “응답이 좋았는가”처럼 넓은 질문보다, “예약 도구를 호출하기 전에 날짜·시간·타임존을 확인했는가”처럼 범위가 좁고 기준이 명확한 rubric에서 더 안정적으로 작동한다. LangSmith에서는 완전한 trace와 구체적인 rubric을 바탕으로 대화를 점수화하고, 변경 사항에 따른 품질 변화를 시간에 따라 비교할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.