LangSmith에서 음성 에이전트 트레이싱하기
·2026.07.22 01:02
LangSmith가 Pipecat, LiveKit 등 주요 프레임워크를 지원하며 음성 에이전트의 가시성을 확보하는 기능을 출시했다.
LangSmith가 Pipecat, LiveKit, OpenAI Realtime, Gemini Live(Google ADK) 등 인기 있는 4대 음성 에이전트 프레임워크에 대한 Python 통합 기능을 출시했다. 음성 에이전트 시장이 급성장함에 따라, 모델의 정밀도와 자연스러움이 향상되면서 이를 관리하기 위한 관측성(Observability)의 중요성도 커지고 있다.
음성 에이전트는 크게 두 가지 아키텍처로 나뉜다. '샌드위치(Sandwich)' 아키텍처는 STT, 텍스트 기반 에이전트, TTS를 체인으로 연결하며, 'Speech-to-Speech' 아키텍처는 멀티모달 모델을 통해 오디오를 직접 처리한다. LangSmith는 두 아키텍처 모두에서 발생하는 복잡한 이벤트를 추적할 수 있다.
새로운 통합 기능을 통해 사용자는 다음과 같은 핵심 데이터를 하나의 트레이스 트리에서 확인할 수 있다:
- 전체 대화 오디오 녹음 및 트레이스 오버레이
- STT 및 TTS 추론 과정의 지연 시간(Latency)과 메타데이터
- 음성 활동 감지(VAD) 및 대화 중단(Interruption) 이벤트
- 모델의 입출력, 도구 호출(Tool calls), 인자 및 결과
- 파이프라인 각 단계별 타이밍 분석
이를 통해 개발자는 음성 에이전트의 동작을 디버깅하고, 성능을 평가하며, 텍스트 에이전트와 동일한 워크플로우 내에서 음성 에이전트를 개선할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.