3초 목소리 혁명
From 1939 to voice clones in 3 seconds — the full AI speech timeline and where it's heading
·2026.04.10 14:58
핵심 내용
음성합성은 Hawking 보이스부터 3초 보이스 클로닝까지 급격히 진화했다.
자세히 보기
음성합성의 흐름이 한눈에 정리된다.
- Dennis Klatt의 음성이 Stephen Hawking의 보이스로 쓰이며 초기 TTS의 상징이 됐다.
- WaveNet은 이전 최고 시스템의 4.21 vs 3.86 점수를 기록하며 품질을 끌어올렸다.
- Tacotron 2는 4.53으로 실제 인간 음성 4.58에 거의 근접했다.
- VALL-E는 3초 샘플로도 화자 목소리를 복제할 수 있었고, 이후 Microsoft는 VALL-E 2 공개를 거절했다.
- Kokoro는 82M 파라미터, $400 학습 비용으로 ElevenLabs와 경쟁 가능한 수준으로 언급된다.
- 2025 Nature 연구에서는 사람들이 AI 음성을 실제 음성보다 더 신뢰할 만하다고 평가했다.
핵심 메시지는 분명하다. 음성 기술은 단순한 합성을 넘어, 짧은 샘플 기반 복제와 심리적 신뢰도까지 다루는 단계로 들어섰다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.