OpenAI가 GPT-Live를 구축한 방법
OpenAI가 실시간 음성 대화를 위해 GPT-Live의 아키텍처를 6개월 만에 구축했다.
GPT-Live는 기존 음성 AI의 turn detector를 오디오 경로에서 제거하고, 음성을 동시에 듣고 말할 수 있는 full-duplex voice model을 적용했다. 사용자가 말을 끝냈는지 별도 모델이 판단할 때까지 기다리지 않아 대화 반응성이 높아진다.
더 깊은 추론이나 tool use가 필요할 때는 GPT-Live가 GPT-5.5 같은 frontier model을 비동기적으로 호출한다. 핵심 음성 경로는 중단 없이 유지하고, 추론·도구 호출·대화 저장 같은 작업은 별도 경로에서 처리한다.
OpenAI는 이를 위해 6개월 동안 model inference, context management, media transport를 다시 설계했다. 클라이언트에서 모델까지 오디오를 스트리밍하는 stateful inference system을 구축해 모든 audio frame을 일정한 시점에 전달하고, 전송·처리 지연으로 인한 음성 공백과 끊김을 줄였다.
아키텍처는 미디어 흐름과 애플리케이션·비즈니스 로직을 분리한다.
- 오디오는 전용 고속 경로로 클라이언트와 voice model 사이를 이동한다.
- delegation, tool use, 백엔드 작업은 비동기 RPC 경계를 통해 처리한다.
- 느린 tool call이나 백엔드 서비스가 실시간 음성 흐름을 막지 못한다.
이 구조는 응답성을 유지하면서 애플리케이션 동작을 독립적으로 커스터마이즈할 수 있게 한다. OpenAI는 이 기반을 ChatGPT Voice의 컴퓨터 제어와 ChatGPT 데스크톱 앱의 에이전트 협업 기능에도 활용하고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.