AI Briefing

OpenAI, Realtime API에 audio model 3종 추가

We’re introducing three audio models in the API that unlock a new class of voice apps for developers.

·2026.05.08 02:32

OpenAI가 Realtime API에 GPT-Realtime-2와 번역·전사 모델 2종을 추가했다.

OpenAI가 Realtime API에 GPT-Realtime-2, GPT-Realtime-Translate, GPT-Realtime-Whisper를 추가했다.

GPT-Realtime-2는 GPT-5급 reasoning을 갖춘 음성 모델로, 대화 중 도구 호출, 중단·수정 대응, 짧은 preamble, 더 자연스러운 톤 제어를 지원한다. 컨텍스트 윈도우는 32K에서 128K로 늘었고, reasoning effort는 minimal / low / medium / high / xhigh 중 선택하며 기본값은 low다.

개선점은 다음과 같다.

  • parallel tool callstool transparency
  • 더 나은 recovery behavior
  • 더 강한 domain understanding
  • 더 세밀한 tone and delivery

OpenAI는 voice-to-action, systems-to-voice, voice-to-voice라는 3가지 패턴을 제시했고, Zillow·Deutsche Telekom·Priceline·Vimeo·BolnaAI 사례를 들어 실제 적용 가능성을 강조했다. 성능에서는 **GPT-Realtime-2 (high)**가 Big Bench Audio에서 GPT-Realtime-1.5 대비 15.2%, xhigh가 Audio MultiChallenge에서 13.8% 높은 결과를 냈다.

함께 공개된 모델은 다음과 같다.

  • GPT-Realtime-Translate: 70+ 입력 언어13개 출력 언어로 실시간 번역
  • GPT-Realtime-Whisper: 말하는 즉시 자막과 전사를 만드는 streaming STT

가격은 GPT-Realtime-2가 오디오 입력 $32/1M tokens, 캐시 입력 $0.40/1M tokens, 오디오 출력 $64/1M tokens이며, Translate$0.034/분, Whisper$0.017/분이다. 세 모델은 Realtime API와 Playground에서 사용할 수 있고, OpenAI는 활성 분류기와 Agents SDK guardrails를 포함한 안전장치도 함께 제시했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.