OpenAI, 음성 모델 3종 공개
OpenAI's New Voice Models Want to Do More Than Talk Back
·2026.05.08 21:50
OpenAI가 Realtime API에 음성 모델 3종을 추가했다.
OpenAI가 Realtime API에 3개 오디오 모델을 추가했다.
- GPT-Realtime-2: GPT-5급 reasoning을 바탕으로 긴 대화, 중단 복구, 도구 호출, 작업 진행 중 응답을 지원한다.
- GPT-Realtime-Translate: 70개+ 입력 언어를 13개 출력 언어로 실시간 번역한다.
- GPT-Realtime-Whisper: 스트리밍 음성 전사를 담당한다.
OpenAI는 음성을 챗봇의 부가 기능이 아니라 인터페이스 자체로 밀고 있다. 고객지원, 일정 조율, 여행 안내, 회의 번역처럼 대화가 이어지는 동안 앱과 연동해 행동까지 수행하는 워크플로를 강조했다.
사례로는 Zillow의 주택 검색·투어 예약, Deutsche Telekom의 다국어 고객지원, Priceline의 대화형 여행 플래닝, Vimeo의 실시간 방송 번역이 언급됐다.
가격은 Realtime-2가 입력 오디오 토큰 100만 개당 $32, 출력 오디오 토큰 100만 개당 $64다. Translate는 분당 $0.034, Whisper는 분당 $0.017이며, Playground에서 바로 테스트할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.