AI Briefing

음성 에이전트 평가 프레임워크 EVA 공개

A New Framework for Evaluating Voice Agents (EVA)

·2026.03.24 11:01

음성 에이전트의 정확도와 대화 경험을 동시에 평가하는 새로운 프레임워크 EVA가 공개되었다.

음성 에이전트는 작업의 **정확도(Accuracy)**와 대화의 **경험(Experience)**이라는 두 가지 상충하는 목표를 동시에 달성해야 하지만, 기존 프레임워크는 이를 분리하여 평가하는 한계가 있었다.

**EVA(End-to-end Voice Agent evaluation)**는 실제와 유사한 bot-to-bot 아키텍처를 통해 멀티턴 음성 대화를 통합적으로 평가하는 프레임워크다. EVA는 다음과 같은 두 가지 핵심 지표를 제공한다.

  • EVA-A (Accuracy): 사용자의 작업을 얼마나 정확하고 충실하게 완료했는가
  • EVA-X (Experience): 대화가 얼마나 자연스럽고, 간결하며, 구어체에 적합한가

항공사 도메인의 50개 시나리오(예약 변경, 취소 등)를 포함한 데이터셋이 함께 공개되었으며, 20개의 S2S(Speech-to-Speech) 및 LALM(Large Audio Language Model) 시스템을 벤치마킹한 결과 **정확도와 대화 경험 사이의 트레이드오프(Trade-off)**가 존재함을 확인했다. 즉, 작업 완료 성능이 높을수록 사용자 경험이 저하되는 경향이 나타났다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.