OpenAI, API에 GPT-Live-1 출시… 풀듀플렉스 음성 대화 지원
핵심 내용
OpenAI가 API에 GPT-Live-1을 출시해 지연 없는 풀듀플렉스 음성 대화와 백엔드 모델 연동을 지원한다.
자세히 보기
OpenAI가 2026년 9월 10일 API에 GPT-Live-1을 출시하며, ChatGPT에서 제공되던 자연스러운 full-duplex(풀듀플렉스) 음성 대화 기능을 개발자에게 개방했다. 이 모델은 수신과 발신 오디오를 단일 모델로 동시에 처리하여 기존 STT-LLM-TTS 파이프라인의 지연과 불안정성을 제거한다.
성능 및 아키텍처 개선
GPT-Live-1은 Full Duplex Bench에서 GPT-Realtime-2.1 대비 성능이 30%p 향상되었으며, turn-taking 지연과 상호작용 행동이 대폭 개선되었다. 학습자 방해(interruptions)는 이전 시스템 대비 약 80% 감소했다. 또한 Tau3 벤치마크에서 GPT-6 Astra(medium reasoning effort)와 페어링 시 1위를 기록하며 항공, 소매, 통신 도메인의 end-to-end 태스크 성공률(Pass@1)을 입증했다.
아키텍처 측면에서는 cascaded build 대비 코드베이스가 80% 간소화되고 23K 줄의 코드가 제거되는 등 개발 복잡도가 크게 낮아졌다. 개발자는 작업 복잡도에 따라 Luna(고빈도 작업)나 Astra(복잡한 추론) 등 백엔드 텍스트 모델을 선택하여 유연성을 확보할 수 있다.
연동 및 활용 사례
GPT-Live-1은 system prompt를 통해 톤, 속도, 스타일을 제어할 수 있으며, 배경 소음 및 침묵 처리가 개선되었다. Yelp, Speak, Fin, Cognition 등 주요 기업들이 자사 서비스에 적용하여 예약 처리율 향상, 자연스러운 대화 흐름 확보, AI 엔지니어와의 협업 경험 개선 등의 효과를 보고했다. Codex SDK와의 연동을 통해 대화 컨텍스트를 Codex thread로 전달하고 응답을 반환하는 구조도 지원한다.
가격 및 가용성
API는 즉시 사용 가능하며, front-end voice layer 기준 분당 $0.05의 가격이 책정되었다. 백엔드 모델 및 agent harness는 제품 요구사항에 맞춰 별도 페어링해야 한다. 기존보다 다양한 액센트와 방언을 포함한 음성 옵션이 제공되며, 향후 몇 달간 언어 가용성이 계속 확장될 예정이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.