monday Service + LangSmith: 첫날부터 구축하는 코드 중심의 평가 전략
monday Service는 LangSmith를 활용해 개발 초기 단계부터 에이전트의 품질을 검증하는 코드 중심 평가 프레임워크를 구축했다.
monday Service는 AI 네이티브 기업 서비스 관리(ESM) 플랫폼으로, 고객 응대를 자동화하는 AI 서비스 워크포스를 구축할 때 개발 초기 단계부터 평가(Evaluation)를 필수 요구사항으로 포함했다.
이들은 LangGraph 기반의 ReAct 에이전트를 활용하며, 추론 단계가 복잡한 에이전트 특성상 발생하는 오류를 방지하기 위해 이중 계층 평가 구조를 채택했다.
1. Offline Evaluations (Safety Net): 단위 테스트처럼 작동하며, 정제된 Golden Dataset을 통해 핵심 로직(Groundedness, Retrieval Accuracy, Tool-calling)과 엣지 케이스를 검증한다. 이를 통해 프롬프트 수정이 기존 기능을 망가뜨리는 것을 방지한다.
2. Online Evaluations (Monitor): 실제 운영 환경에서 에이전트의 성능을 지속적으로 모니터링한다. 자동 해결률(Automated Resolution) 및 격리율(Containment)과 같은 비즈니스 지표를 실시간으로 추적하고 개선한다.
이러한 Evals-driven development 프레임워크를 통해 평가 피드백 루프를 8.7배 단축(162초 → 18초)했으며, 수백 개의 사례를 단 몇 분 만에 포괄적으로 테스트할 수 있는 환경을 구축했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.