AI Briefing

OpenAI, 음성 모델 3종 공개

OpenAI's New Voice Models Want to Do More Than Talk Back

·2026.05.08 21:50

핵심 내용

OpenAI가 Realtime API에 음성 모델 3종을 추가했다.

자세히 보기

OpenAI가 Realtime API에 3개 오디오 모델을 추가했다.

  • GPT-Realtime-2: GPT-5급 reasoning을 바탕으로 긴 대화, 중단 복구, 도구 호출, 작업 진행 중 응답을 지원한다.
  • GPT-Realtime-Translate: 70개+ 입력 언어를 13개 출력 언어로 실시간 번역한다.
  • GPT-Realtime-Whisper: 스트리밍 음성 전사를 담당한다.

OpenAI는 음성을 챗봇의 부가 기능이 아니라 인터페이스 자체로 밀고 있다. 고객지원, 일정 조율, 여행 안내, 회의 번역처럼 대화가 이어지는 동안 앱과 연동해 행동까지 수행하는 워크플로를 강조했다.

사례로는 Zillow의 주택 검색·투어 예약, Deutsche Telekom의 다국어 고객지원, Priceline의 대화형 여행 플래닝, Vimeo의 실시간 방송 번역이 언급됐다.

가격은 Realtime-2가 입력 오디오 토큰 100만 개당 $32, 출력 오디오 토큰 100만 개당 $64다. Translate는 분당 $0.034, Whisper는 분당 $0.017이며, Playground에서 바로 테스트할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.