API를 위한 차세대 오디오 모델 공개
·2025.03.20 20:00
OpenAI가 정교한 음성 인식과 맞춤형 음성 합성이 가능한 차세대 오디오 모델을 API로 출시했다.
OpenAI가 더욱 직관적인 상호작용을 지원하기 위해 API를 통해 새로운 speech-to-text(STT) 및 text-to-speech(TTS) 오디오 모델을 출시했다. 이를 통해 개발자는 더욱 강력하고 맞춤화된 voice agent를 구축할 수 있다.
새로운 STT 모델인 gpt-4o-transcribe와 gpt-4o-mini-transcribe는 기존 Whisper 모델보다 향상된 **WER(Word Error Rate)**을 기록했다. 특히 억양, 소음이 심한 환경, 다양한 말하기 속도 등 까다로운 상황에서도 높은 정확도와 신뢰성을 보여준다.
TTS 모델에서는 개발자가 특정 말투를 지시할 수 있는 기능이 처음으로 도입되었다. 예를 들어 "공감 능력이 뛰어난 고객 서비스 상담원처럼 말해줘"와 같은 지시를 통해 감정 표현이 풍부한 음성을 구현할 수 있어, 창의적인 스토리텔링부터 고객 서비스까지 폭넓은 활용이 가능하다.
주요 특징은 다음과 같다:
- gpt-4o-transcribe 및 gpt-4o-mini-transcribe 모델 도입
- FLEURS 벤치마크에서 Whisper v2/v3를 상회하는 성능 입증
- 강화 학습과 고품질 데이터셋을 통한 정확도 및 언어 인식 능력 개선
- 특정 캐릭터나 감정을 반영한 맞춤형 음성 생성 가능
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.