OpenAI, Realtime API에 audio model 3종 추가
We’re introducing three audio models in the API that unlock a new class of voice apps for developers.
OpenAI가 Realtime API에 GPT-Realtime-2와 번역·전사 모델 2종을 추가했다.
OpenAI가 Realtime API에 GPT-Realtime-2, GPT-Realtime-Translate, GPT-Realtime-Whisper를 추가했다.
GPT-Realtime-2는 GPT-5급 reasoning을 갖춘 음성 모델로, 대화 중 도구 호출, 중단·수정 대응, 짧은 preamble, 더 자연스러운 톤 제어를 지원한다. 컨텍스트 윈도우는 32K에서 128K로 늘었고, reasoning effort는 minimal / low / medium / high / xhigh 중 선택하며 기본값은 low다.
개선점은 다음과 같다.
- parallel tool calls와 tool transparency
- 더 나은 recovery behavior
- 더 강한 domain understanding
- 더 세밀한 tone and delivery
OpenAI는 voice-to-action, systems-to-voice, voice-to-voice라는 3가지 패턴을 제시했고, Zillow·Deutsche Telekom·Priceline·Vimeo·BolnaAI 사례를 들어 실제 적용 가능성을 강조했다. 성능에서는 **GPT-Realtime-2 (high)**가 Big Bench Audio에서 GPT-Realtime-1.5 대비 15.2%, xhigh가 Audio MultiChallenge에서 13.8% 높은 결과를 냈다.
함께 공개된 모델은 다음과 같다.
- GPT-Realtime-Translate: 70+ 입력 언어를 13개 출력 언어로 실시간 번역
- GPT-Realtime-Whisper: 말하는 즉시 자막과 전사를 만드는 streaming STT
가격은 GPT-Realtime-2가 오디오 입력 $32/1M tokens, 캐시 입력 $0.40/1M tokens, 오디오 출력 $64/1M tokens이며, Translate는 $0.034/분, Whisper는 $0.017/분이다. 세 모델은 Realtime API와 Playground에서 사용할 수 있고, OpenAI는 활성 분류기와 Agents SDK guardrails를 포함한 안전장치도 함께 제시했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.