AI Briefing

LLM 기반 텍스트 음성 합성 시스템의 품질과 견고성 향상

·2026.04.02 03:13

핵심 내용

LoRA, CFG, chain-of-thought로 LLM 기반 TTS의 억양 누출·환각·중단을 줄였다.

자세히 보기

LLM 기반 TTS는 짧은 음성 샘플만으로도 자연스러운 음성을 만들지만, 여전히 억양 누출, 표현력 부족, 신뢰성 문제가 남아 있다. Amazon은 이를 해결하기 위해 locale별 데이터 증강, LoRA 미세조정, classifier-free guidance(CFG), 그리고 chain-of-thought 기반 검증을 결합했다.

폴리글롯 TTS에서 가장 큰 문제는 accent leakage다. 영어 음성을 프랑스어, 독일어, 스페인어로 옮길 때 원래 화자의 억양이 섞이거나, 반대로 목표 언어 억양이 화자 고유의 목소리 특성을 덮어버린다. Amazon은 target locale 비중을 크게 높인 데이터로 LoRA를 적용해, 목표 언어에서는 자연스러운 발음을 내면서도 화자 정체성은 유지하는 accent-free voice cloning을 구현했다.

표현력은 CFG로 보강했다. 감정, 웃음, 한숨, 머뭇거림 같은 요소가 더 잘 드러나도록 synthetic reference audio를 생성하고, 이를 inference 조건으로 사용해 더 풍부한 prosody를 유도한다. 이 방식은 화자 정체성과 억양을 분리해 학습시키므로, 적은 수의 녹음 음성만으로도 더 많은 locale과 언어에 확장할 수 있다.

성과도 제시했다. MUSHRA 청취 평가 기준으로, 9개 locale 전반에서 이전 모델군 대비 품질이 5%~20% 개선됐다.

  • US-English: +12.43%
  • Southern US-English: +20.05%
  • Great Britain-English: +5.97%
  • Australia-English: +5.50%
  • US-Spanish: +11.78%
  • Spain-Spanish: +13.23%
  • France-French: +8.44%
  • Germany-German: +14.12%
  • Italy-Italian: +9.80%

신뢰성 문제는 더 까다롭다. 전통적인 TTS는 grapheme-to-phoneme, duration prediction, acoustic generation 같은 명시적 단계가 있지만, autoregressive LLM-based TTS는 길이 계획 없이 speech token을 하나씩 생성한다. 그 결과 hallucination, random truncation, 발음 불일치가 발생한다.

이를 위해 Amazon은 생성 전에 chain-of-thought reasoning을 넣어 먼저 phoneme sequence와 duration을 예측하게 한다. 이 예측은 다음 두 가지 면에서 유용하다.

  • Phoneme prediction: "read", "lead" 같은 heteronym이나 낯선 이름을 더 안정적으로 처리
  • Duration prediction: 전체 길이와 음소별 타이밍 계획을 세워 hallucination과 truncation 감소

여기에 guardrails를 붙여, 생성 후 결과 길이와 duration이 사전 예측과 맞는지 검사한다. phoneme 수 대비 출력 길이가 비정상적으로 길거나 짧으면 문제로 간주하고, 필요하면 다른 sampling parameter로 재생성하거나 대체 경로로 fallback한다.

데이터 정제도 병행했다. 단순 ASR 기반 필터링만 쓰면 잘 맞는 데이터뿐 아니라 표현력이 풍부한 샘플도 일부 버려질 수 있어서, Amazon은 ASR metrics와 attention mechanism 기반 지표를 함께 사용해 정렬이 좋은 데이터는 살리고 표현성은 유지했다.

이 조합을 적용한 결과, 일반적인 long-form text에서 critical errors는 평균 시간당 1초 미만으로 줄었다. 여기서 critical errors는 hallucination, 한 단어를 넘는 cutoff, 입력 텍스트와 출력 음성의 불일치를 뜻한다. 결국 LLM 기반 TTS는 전통적 시스템보다 자연스럽지만, 배포하려면 억양·표현력·안정성을 모두 보강하는 추가 설계가 필요하다는 결론이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.