Voice Engine의 작동 방식과 안전 연구에 대한 상세 설명
·2024.06.08 02:45
OpenAI가 15초의 음성 샘플로 맞춤형 목소리를 생성하는 Voice Engine의 기술적 원리와 안전 연구 내용을 공개했다.
Voice Engine은 텍스트와 단 15초의 음성 샘플만으로 인간과 유사한 오디오를 생성하는 TTS(Text-to-Speech) 모델이다. 이 모델은 특정 화자를 위해 별도의 파인튜닝이나 모델 커스텀 과정을 거치지 않는다.
대신 디퓨전(Diffusion) 프로세스를 활용한다. 무작위 노이즈에서 시작하여, 15초 샘플에 담긴 화자의 억양, 악센트, 말하기 스타일을 정밀하게 재현할 수 있도록 단계적으로 노이즈를 제거하며 오디오를 생성하는 방식이다.
2022년 말 개발을 시작한 이 모델은 내부 테스트와 정책 입안자 대상 기술 시연을 거쳐왔다. 현재 ChatGPT Voice Mode와 TTS API 등에 제한적으로 적용되어 있으며, 최근에는 신뢰할 수 있는 파트너들을 대상으로 맞춤형 목소리 생성 기능을 프리뷰 형태로 제공하고 있다.
OpenAI는 합성 음성 기술의 위험성을 관리하기 위해 다음과 같은 안전 목표를 추진 중이다:
- 은행 계좌 접속 등 보안을 위한 음성 기반 인증의 단계적 폐지
- AI 시대 개인의 목소리 권리 보호를 위한 정책 탐색
- 기만적인 AI 콘텐츠에 대한 대중의 이해도 제고
- 오디오 콘텐츠의 출처를 추적하는 기술 개발 및 도입 가속화
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.