KugelAudio, 저지연 실시간 TTS 모델 출시
KugelAudio
·2026.05.28 05:30
60ms 미만의 저지연과 셀프 호스팅을 지원하는 실시간 TTS 및 보이스 클로닝 모델이 출시되었다.
보이스 에이전트 최적화를 위해 설계된 실시간 Text-to-Speech(TTS) 모델인 KugelAudio가 출시되었다. 30~60초 분량의 오디오 샘플만으로 목소리를 복제할 수 있는 보이스 클로닝 기능을 핵심으로 한다.
주요 기술적 특징은 다음과 같다:
- 초저지연 성능: 네트워크 지연을 제외하고 60ms 미만의 레이턴시를 구현하여 실시간 대화형 AI에 최적화되었다.
- 유연한 배포 옵션: API 호출 방식 외에도 데이터 보안이 중요한 환경을 위해 자체 클러스터에서 실행 가능한 온프레미스(On-premise) 및 셀프 호스팅을 지원한다.
- 고도화된 언어 처리: 25개 이상의 언어를 지원하며, 전화번호, 주소, 약물명 등을 자연스럽게 읽는 문법 인식 정규화 기능을 갖췄다.
- 에코시스템 통합: LiveKit, Pipecat, Vapi를 위한 어댑터를 제공하며, Python, JS, Java SDK를 통해 개발자 접근성을 높였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.