AI Briefing

API의 새 음성 모델로 음성 AI를 강화

·2026.05.08 04:00

OpenAI가 Realtime API에 추론·번역·전사를 지원하는 실시간 음성모델 3종을 공개했다.

OpenAIRealtime APIGPT-Realtime-2, GPT-Realtime-Translate, GPT-Realtime-Whisper를 추가했다. 세 모델은 말이 끝나기를 기다리지 않고 추론, 번역, 전사를 실시간으로 처리해 음성 경험을 한 단계 끌어올린다.

음성 인터페이스는 세 가지 패턴으로 정리된다.

  • voice-to-action: 사용자의 요청을 추론해 도구를 호출하고 작업을 끝내는 방식
  • systems-to-voice: 서비스가 맥락을 읽고 음성으로 먼저 안내하는 방식
  • voice-to-voice: 언어와 문맥을 넘나들며 대화를 이어가는 방식 OpenAIZillow, Priceline, Deutsche Telekom 사례를 통해 이런 패턴이 고객지원, 여행, 다국어 대화에서 함께 작동할 수 있다고 설명했다.

GPT-Realtime-2GPT-5급 추론을 갖춘 첫 음성 모델이다. 짧은 사전 멘트(preambles), 병렬 도구 호출, 도구 호출 투명성으로 요청 처리 중임을 드러내고, 더 나은 오류 복구와 더 자연스러운 끼어들기 처리, 더 강한 도메인 용어 이해, 더 세밀한 톤 제어를 지원한다. context window32K → 128K로 늘었고, reasoning effort는 minimal, low, medium, high, xhigh 중 선택하며 기본값은 low다.

평가 결과도 개선됐다. **GPT-Realtime-2 (high)**는 Big Bench Audio에서 GPT-Realtime-1.5보다 15.2% 높았고, **GPT-Realtime-2 (xhigh)**는 Audio MultiChallenge에서 13.8% 높았다. Zillow는 프롬프트 최적화 뒤 난이도 높은 벤치마크에서 콜 성공률이 **95% 대 69%**로 26포인트 올랐다고 밝혔다.

GPT-Realtime-Translate70개 이상 입력 언어13개 출력 언어로 실시간 번역하고, 대화 속도를 유지한 채 전사도 제공한다. Deutsche Telekom은 다국어 고객지원에, Vimeo는 제품 교육 영상을 실시간 번역하는 활용에, BolnaAI는 힌디어·타밀어·텔루구 평가에서 다른 모델 대비 WER 12.5% 감소와 낮은 fallback, 더 높은 작업 완료율을 확인했다고 전했다.

GPT-Realtime-Whisper는 발화를 따라가며 즉시 전사하는 스트리밍 speech-to-text 모델이다. 회의 자막, 수업·방송 자막, 메모와 요약, 고객지원·헬스케어·세일즈·리크루팅 같은 고빈도 음성 업무에 맞춰졌다.

안전성 측면에서는 Realtime API 세션에 활성 분류기를 적용해 유해 콘텐츠로 판단되면 대화를 중단할 수 있고, 개발자는 Agents SDK 가드레일을 붙일 수 있다. 사용 정책은 출력을 스팸·기만·유해 목적에 재사용하거나 배포하는 것도 금지하며, 사용자에게 AI와 상호작용 중임을 명확히 알리도록 요구한다.

가격은 GPT-Realtime-2가 오디오 입력 토큰 100만 개당 $32(캐시 입력 $0.40), 오디오 출력 토큰 100만 개당 $64다. GPT-Realtime-Translate분당 $0.034, GPT-Realtime-Whisper분당 $0.017이며, 세 모델은 Realtime API에서 사용할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.