AI Briefing

반응성 높은 음성 AI를 위한 실시간 시스템을 6개월 만에 구축한 방법

·2026.08.03 16:00

OpenAI는 GPT-Live의 자연스러운 음성 대화를 위해 실시간·양방향 시스템을 구축했다.

OpenAI는 음성 AI가 사람처럼 자연스럽게 대화하도록 GPT-Live의 실시간 시스템을 6개월 만에 재설계했다. 기존 음성 AI는 작은 turn detector가 사용자의 발화 종료를 먼저 판단한 뒤 LLM이 응답하는 방식이어서, 너무 빠르면 말을 끊고 늦으면 반응이 느려지는 문제가 있었다.

GPT-Live는 음성 모델이 듣고 말하는 작업을 동시에 수행하는 full-duplex 구조를 적용해 별도의 turn detector를 오디오 경로에서 제거했다. 오디오를 모델로 계속 입력하고 생성된 음성을 사용자에게 스트리밍하면서, 대규모 추론이나 도구 사용은 별도의 비동기 경로에서 처리한다.

핵심 설계는 실시간 미디어 루프와 애플리케이션 로직을 분리하는 것이다. 음성 흐름을 유지하는 경로와 frontier model 호출, 대화 저장, 도구 실행 같은 작업을 분리해 애플리케이션 기능을 확장해도 응답성을 저하시키지 않도록 했다.

시스템은 다음 요소를 함께 최적화했다.

  • 상태 기반 추론으로 연속적인 대화를 지원
  • 동적 컨텍스트 관리로 실시간 음성 처리에 필요한 정보를 조정
  • 비동기 위임으로 GPT-5.5 같은 frontier model과 도구를 대화 흐름 중에 호출
  • 프로토콜 및 미디어 전송 최적화로 오디오 프레임을 일정한 시점에 전달

이 아키텍처는 ChatGPT Voice의 컴퓨터 제어와 에이전트 조정 같은 기능을 뒷받침하며, 음성 대화의 즉각적인 반응성과 복잡한 추론 능력을 함께 제공하는 기반이 된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.