AI Briefing

Fish Audio, 83개 언어 지원하는 S2.1 Pro 출시

·2026.07.29 09:00

핵심 내용

Fish Audio가 실시간 대화에 최적화된 고성능 음성 모델 S2.1 Pro를 출시했다.

자세히 보기

Fish Audio가 기존의 스크립트 낭독 방식에서 벗어나 실시간 대화형 음성에 최적화된 생산용 음성 모델 S2.1 Pro를 출시했다. 이 모델은 Fish Audio API를 통해 제공되며, 개발 및 테스트를 위한 무료 티어도 함께 지원한다.

S2.1 Pro의 핵심 강점은 낮은 지연 시간과 광범위한 언어 지원이다. 주요 특징은 다음과 같다:

  • 초저지연 성능: 표준 호출 시 첫 오디오 출력까지 약 90ms의 지연 시간(Time-to-first-audio)을 기록하여 자연스러운 대화가 가능하다.
  • 다국어 지원: 단일 음성 정체성을 유지하며 83개 언어를 지원한다.
  • 세밀한 감정 제어: 텍스트 내에 브래킷 태그를 직접 입력하여 속삭임이나 긴장한 웃음 등의 지시를 별도의 설정 없이 수행할 수 있다.
  • 고성능 클로닝: 10~30초 정도의 짧은 샘플만으로도 추가 파인튜닝 없이 화자의 톤과 스타일을 캡처한다.

이번 모델은 MCP 및 Agent-skill 지원을 통해 에이전트 워크플로우에 쉽게 통합될 수 있어, 음성 에이전트나 전화 시스템, 롱폼 오디오 파이프라인을 구축하는 개발자들에게 유용하다. 또한, GitHub에서 2만 개 이상의 스타를 기록한 오픈소스 Fish Speech 라인업의 기술적 성과를 바탕으로 구축되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.