AI Briefing

Gemini 3.1 Flash TTS: 차세대 표현형 AI 음성

·2026.04.16 00:00

핵심 내용

Gemini 3.1 Flash TTS가 audio tags와 70+개 언어로 더 자연스러운 음성을 만든다.

1 / 2

자세히 보기

Gemini 3.1 Flash TTS가 더 높은 제어 가능성, 표현력, 음질을 내세우며 공개됐다. 개발자, 기업, 일반 사용자가 AI 음성 애플리케이션을 더 정교하게 만들 수 있도록 설계됐고, 현재 Gemini API, Google AI Studio, Vertex AI, Google Vids에서 순차적으로 미리보기로 제공된다.

음성 품질도 크게 개선됐다. Google은 이 모델이 지금까지의 모델 중 가장 자연스럽고 표현력이 뛰어나다고 설명했으며, Artificial Analysis TTS leaderboard에서 Elo 1,211을 기록했다고 밝혔다. 또한 native multi-speaker dialogue를 지원하고, 70개 이상 언어에서 동작하며, 품질과 비용의 균형이 좋은 구간에 위치한다고 강조했다.

가장 큰 변화는 audio tags다. 텍스트 입력 안에 자연어 지시를 넣어 발화 스타일, 속도, 전달 방식을 세밀하게 조절할 수 있고, Google AI Studio에서는 이를 더 직관적으로 다룰 수 있는 개발자 경험도 제공한다.

핵심 기능은 다음과 같다.

  • Scene direction: 장면과 대사 지시를 넣어 캐릭터의 맥락과 반응을 유지
  • Speaker-level specificity: Audio Profiles와 Director’s Notes로 톤, 속도, 악센트를 세부 조정
  • Seamless export: 조정한 파라미터를 Gemini API 코드로 내보내 일관된 음성 재사용 가능

기업용 활용도 함께 겨냥했다. Google은 이런 제어 기능이 제품, 캐릭터, 인터랙티브 경험, 로컬라이제이션이 중요한 서비스에서 특히 유용하다고 설명하며, Google AI Studio Playground에서 바로 실험해볼 수 있다고 안내했다.

배포와 함께 SynthID 워터마킹도 적용된다. Gemini 3.1 Flash TTS가 생성한 모든 오디오는 보이지 않는 워터마크를 포함해 AI 생성 여부를 식별할 수 있게 하며, 이는 허위정보 확산을 줄이기 위한 안전장치로 제시됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.