API를 위한 차세대 오디오 모델 공개
·2025.03.20 20:00
핵심 내용
OpenAI가 정교한 음성 인식과 맞춤형 음성 합성이 가능한 차세대 오디오 모델을 API로 출시했다.
자세히 보기
OpenAI가 더욱 직관적인 상호작용을 지원하기 위해 API를 통해 새로운 speech-to-text(STT) 및 text-to-speech(TTS) 오디오 모델을 출시했다. 이를 통해 개발자는 더욱 강력하고 맞춤화된 voice agent를 구축할 수 있다.
새로운 STT 모델인 gpt-4o-transcribe와 gpt-4o-mini-transcribe는 기존 Whisper 모델보다 향상된 **WER(Word Error Rate)**을 기록했다. 특히 억양, 소음이 심한 환경, 다양한 말하기 속도 등 까다로운 상황에서도 높은 정확도와 신뢰성을 보여준다.
TTS 모델에서는 개발자가 특정 말투를 지시할 수 있는 기능이 처음으로 도입되었다. 예를 들어 "공감 능력이 뛰어난 고객 서비스 상담원처럼 말해줘"와 같은 지시를 통해 감정 표현이 풍부한 음성을 구현할 수 있어, 창의적인 스토리텔링부터 고객 서비스까지 폭넓은 활용이 가능하다.
주요 특징은 다음과 같다:
- gpt-4o-transcribe 및 gpt-4o-mini-transcribe 모델 도입
- FLEURS 벤치마크에서 Whisper v2/v3를 상회하는 성능 입증
- 강화 학습과 고품질 데이터셋을 통한 정확도 및 언어 인식 능력 개선
- 특정 캐릭터나 감정을 반영한 맞춤형 음성 생성 가능
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.