합성 음성의 과제와 기회
·2024.03.29 09:00
OpenAI가 15초의 샘플로 자연스러운 목소리를 생성하는 **Voice Engine**의 초기 활용 사례와 안전한 배포 방안을 공개했다.
Voice Engine은 텍스트 입력과 단 15초의 오디오 샘플만으로 원본 화자와 매우 유사하고 감정이 실린 자연스러운 음성을 생성하는 모델이다. OpenAI는 이 기술을 text-to-speech API, ChatGPT Voice, Read Aloud 등에 활용해 왔으며, 현재는 오용 가능성을 고려해 신중하게 소규모 프리뷰를 진행하며 사회적 적응 방안을 모색하고 있다.
현재 신뢰할 수 있는 파트너들과 함께 다양한 산업 분야에서 기술의 잠재력을 테스트하고 있다. 주요 활용 사례는 다음과 같다:
- 교육: Age of Learning은 맞춤형 음성 콘텐츠와 실시간 상호작용을 통해 아동 학습을 지원한다.
- 번역: HeyGen은 화자의 고유한 억양을 유지하면서 영상을 다국어로 번역한다.
- 글로벌 서비스: Dimagi는 스와힐리어 등 현지 언어를 지원하여 원격 지역 보건 인력의 역량 강화를 돕는다.
- 장애 및 의료: Livox는 비구어 사용자를 위한 맞춤형 음성을 제공하며, Lifespan은 질병으로 목소리를 잃은 환자의 음성 복구를 연구한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.