Fish Audio, 83개 언어 지원하는 S2.1 Pro 출시
·2026.07.29 09:00
Fish Audio가 실시간 대화에 최적화된 고성능 음성 모델 S2.1 Pro를 출시했다.
Fish Audio가 기존의 스크립트 낭독 방식에서 벗어나 실시간 대화형 음성에 최적화된 생산용 음성 모델 S2.1 Pro를 출시했다. 이 모델은 Fish Audio API를 통해 제공되며, 개발 및 테스트를 위한 무료 티어도 함께 지원한다.
S2.1 Pro의 핵심 강점은 낮은 지연 시간과 광범위한 언어 지원이다. 주요 특징은 다음과 같다:
- 초저지연 성능: 표준 호출 시 첫 오디오 출력까지 약 90ms의 지연 시간(Time-to-first-audio)을 기록하여 자연스러운 대화가 가능하다.
- 다국어 지원: 단일 음성 정체성을 유지하며 83개 언어를 지원한다.
- 세밀한 감정 제어: 텍스트 내에 브래킷 태그를 직접 입력하여 속삭임이나 긴장한 웃음 등의 지시를 별도의 설정 없이 수행할 수 있다.
- 고성능 클로닝: 10~30초 정도의 짧은 샘플만으로도 추가 파인튜닝 없이 화자의 톤과 스타일을 캡처한다.
이번 모델은 MCP 및 Agent-skill 지원을 통해 에이전트 워크플로우에 쉽게 통합될 수 있어, 음성 에이전트나 전화 시스템, 롱폼 오디오 파이프라인을 구축하는 개발자들에게 유용하다. 또한, GitHub에서 2만 개 이상의 스타를 기록한 오픈소스 Fish Speech 라인업의 기술적 성과를 바탕으로 구축되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.