AI Briefing

LangSmith에서 음성 에이전트 트레이싱하기

·2026.07.22 01:02

LangSmith가 Pipecat, LiveKit 등 주요 프레임워크를 지원하며 음성 에이전트의 가시성을 확보하는 기능을 출시했다.

LangSmith가 Pipecat, LiveKit, OpenAI Realtime, Gemini Live(Google ADK) 등 인기 있는 4대 음성 에이전트 프레임워크에 대한 Python 통합 기능을 출시했다. 음성 에이전트 시장이 급성장함에 따라, 모델의 정밀도와 자연스러움이 향상되면서 이를 관리하기 위한 관측성(Observability)의 중요성도 커지고 있다.

음성 에이전트는 크게 두 가지 아키텍처로 나뉜다. '샌드위치(Sandwich)' 아키텍처는 STT, 텍스트 기반 에이전트, TTS를 체인으로 연결하며, 'Speech-to-Speech' 아키텍처는 멀티모달 모델을 통해 오디오를 직접 처리한다. LangSmith는 두 아키텍처 모두에서 발생하는 복잡한 이벤트를 추적할 수 있다.

새로운 통합 기능을 통해 사용자는 다음과 같은 핵심 데이터를 하나의 트레이스 트리에서 확인할 수 있다:

  • 전체 대화 오디오 녹음 및 트레이스 오버레이
  • STT 및 TTS 추론 과정의 지연 시간(Latency)과 메타데이터
  • 음성 활동 감지(VAD) 및 대화 중단(Interruption) 이벤트
  • 모델의 입출력, 도구 호출(Tool calls), 인자 및 결과
  • 파이프라인 각 단계별 타이밍 분석

이를 통해 개발자는 음성 에이전트의 동작을 디버깅하고, 성능을 평가하며, 텍스트 에이전트와 동일한 워크플로우 내에서 음성 에이전트를 개선할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.