Gemini 3.1 Flash TTS - 자연어로 음성 스타일을 제어하는 차세대 AI 음성 모델
·2026.04.16 07:18
핵심 내용
Google의 새 TTS 모델이 자연어 오디오 태그로 음성 스타일을 정밀 제어한다.
자세히 보기
Google이 Gemini 3.1 Flash TTS를 프리뷰로 공개했다. 기존 대비 자연스러움, 표현력, 제어성을 크게 높인 텍스트-투-스피치 모델로, 개발자와 기업, 일반 사용자가 AI 음성 애플리케이션을 만들 수 있게 한다.
현재 제공 채널은 다음과 같다.
- Gemini API와 Google AI Studio: 개발자용
- Vertex AI: 기업용
- Google Vids: Workspace 사용자용
핵심 변화는 **오디오 태그(audio tags)**다. 텍스트 안에 자연어 지시를 직접 넣어 음성 스타일, 속도, 전달 방식을 세밀하게 조절할 수 있다. Google AI Studio에서는 이를 통해 장면 설정, 캐릭터별 Audio Profile, Director's Notes, 인라인 태그 같은 방식으로 더 정교한 음성 연출이 가능하다.
성능 측면에서는 Artificial Analysis TTS 리더보드 Elo 1,211을 기록했고, 고품질 음성과 낮은 비용의 조합으로 평가됐다. 또한 70개 이상 언어를 지원하며, native multi-speaker 대화 기능도 내장돼 있다.
보안과 신뢰성 측면에서는 생성되는 모든 오디오에 SynthID 워터마크를 적용해 AI 생성 음성을 탐지할 수 있게 했다. 이를 통해 콘텐츠 신뢰성 확보와 허위정보 대응을 지원한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.