AI Briefing

monday Service + LangSmith: 첫날부터 구축하는 코드 중심의 평가 전략

·2026.02.18 17:05

monday Service는 LangSmith를 활용해 개발 초기 단계부터 에이전트의 품질을 검증하는 코드 중심 평가 프레임워크를 구축했다.

monday Service는 AI 네이티브 기업 서비스 관리(ESM) 플랫폼으로, 고객 응대를 자동화하는 AI 서비스 워크포스를 구축할 때 개발 초기 단계부터 평가(Evaluation)를 필수 요구사항으로 포함했다.

이들은 LangGraph 기반의 ReAct 에이전트를 활용하며, 추론 단계가 복잡한 에이전트 특성상 발생하는 오류를 방지하기 위해 이중 계층 평가 구조를 채택했다.

1. Offline Evaluations (Safety Net): 단위 테스트처럼 작동하며, 정제된 Golden Dataset을 통해 핵심 로직(Groundedness, Retrieval Accuracy, Tool-calling)과 엣지 케이스를 검증한다. 이를 통해 프롬프트 수정이 기존 기능을 망가뜨리는 것을 방지한다.

2. Online Evaluations (Monitor): 실제 운영 환경에서 에이전트의 성능을 지속적으로 모니터링한다. 자동 해결률(Automated Resolution) 및 격리율(Containment)과 같은 비즈니스 지표를 실시간으로 추적하고 개선한다.

이러한 Evals-driven development 프레임워크를 통해 평가 피드백 루프를 8.7배 단축(162초 → 18초)했으며, 수백 개의 사례를 단 몇 분 만에 포괄적으로 테스트할 수 있는 환경을 구축했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.