AI Briefing

gpt-realtime 및 Realtime API 업데이트 소개

·2025.08.28 19:00

OpenAI가 향상된 음성 대화 모델인 gpt-realtime과 기능이 강화된 Realtime API를 공개했다.

OpenAI가 Realtime API를 정식 출시(GA)하며, 더욱 진화된 음성 대화 모델인 gpt-realtime을 선보였다. 이번 업데이트를 통해 개발자는 더욱 신뢰할 수 있는 프로덕션급 보이스 에이전트를 구축할 수 있다.

새로운 API는 MCP(Model Context Protocol) 서버 지원, 이미지 입력, 그리고 **SIP(Session Initiation Protocol)**를 통한 전화 연결 기능을 포함한다. 이를 통해 보이스 에이전트가 추가적인 도구와 컨텍스트에 접근하여 더욱 강력한 기능을 수행할 수 있게 되었다.

gpt-realtime은 기존의 STT(음성-텍스트 변환)와 TTS(텍스트-음성 변환) 모델을 체인 형태로 연결하던 방식과 달리, 단일 모델이 오디오를 직접 처리하고 생성한다. 이 방식은 지연 시간을 줄이고 음성의 미묘한 뉘앙스를 보존하여 훨씬 자연스러운 대화를 가능하게 한다.

주요 개선 사항은 다음과 같다:

  • 오디오 품질: 더 자연스러운 억양과 감정 표현이 가능하며, CedarMarin이라는 두 가지 새로운 음성이 추가되었다.
  • 지능 및 이해도: 웃음과 같은 비언어적 신호를 포착하고 문장 중간에 언어를 전환할 수 있다. Big Bench Audio 벤치마크에서 82.8%의 정확도를 기록하며 이전 모델(65.6%)을 크게 앞질렀다.
  • 지시 이행 및 도구 사용: 복잡한 명령 수행 능력과 정밀한 Function Calling 능력이 대폭 향상되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.