AI Briefing

3초 목소리 혁명

From 1939 to voice clones in 3 seconds — the full AI speech timeline and where it's heading

·2026.04.10 14:58

핵심 내용

음성합성은 Hawking 보이스부터 3초 보이스 클로닝까지 급격히 진화했다.

자세히 보기

음성합성의 흐름이 한눈에 정리된다.

  • Dennis Klatt의 음성이 Stephen Hawking의 보이스로 쓰이며 초기 TTS의 상징이 됐다.
  • WaveNet은 이전 최고 시스템의 4.21 vs 3.86 점수를 기록하며 품질을 끌어올렸다.
  • Tacotron 2는 4.53으로 실제 인간 음성 4.58에 거의 근접했다.
  • VALL-E는 3초 샘플로도 화자 목소리를 복제할 수 있었고, 이후 Microsoft는 VALL-E 2 공개를 거절했다.
  • Kokoro는 82M 파라미터, $400 학습 비용으로 ElevenLabs와 경쟁 가능한 수준으로 언급된다.
  • 2025 Nature 연구에서는 사람들이 AI 음성을 실제 음성보다 더 신뢰할 만하다고 평가했다.

핵심 메시지는 분명하다. 음성 기술은 단순한 합성을 넘어, 짧은 샘플 기반 복제와 심리적 신뢰도까지 다루는 단계로 들어섰다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.