AI Briefing

대화는 순서를 기다리지 않는다: 실시간 음성 대화 AI를 위한 데이터 파이프라인 ‘Sommelier’

·2026.07.16 14:41

핵심 내용

네이버가 실시간 음성 대화 AI의 지연 시간을 최소화하기 위한 데이터 파이프라인 'Sommelier'를 공개했다.

자세히 보기

실시간 음성 대화 AI는 사용자의 발화가 끝나기를 기다리지 않고 즉각적으로 반응해야 하므로, 기존의 순차적인 처리 방식으로는 한계가 있다. 이를 해결하기 위해 네이버는 Sommelier라는 새로운 데이터 파이프라인을 설계했다.

Sommelier는 다음과 같은 핵심 메커니즘을 통해 실시간성을 확보한다.

  • Streaming 기반 처리: 음성 데이터를 조각(Chunk) 단위로 나누어 처리하여 지연 시간을 단축한다.
  • 비동기 파이프라인: 각 단계(STT, LLM, TTS)를 독립적인 스트림으로 관리하여 병렬 처리를 극대화한다.
  • 동적 오케스트레이션: 대화의 맥락과 네트워크 상태에 따라 데이터 흐름을 유연하게 제어한다.

이 시스템은 음성 인식(STT)과 생성(LLM), 음성 합성(TTS) 과정을 유기적으로 연결하여, 마치 사람과 대화하는 듯한 자연스러운 응답 속도를 구현하는 것을 목표로 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.