AI Briefing

실시간 대화용 Gepard 1.0 오픈소스 공개

Gepard : 0.6B streaming TTS built for real-time dialogue - 20× realtime factor, ~50ms time-to-first-audio, vLLM-native, Apache 2.0

·2026.07.08 01:59

실시간 대화에 최적화된 0.6B 파라미터 규모의 스트리밍 TTS 모델 Gepard 1.0이 오픈소스로 공개되었습니다.

실시간 대화형 AI를 위해 설계된 Gepard 1.0이 Apache 2.0 라이선스로 오픈소스 공개되었습니다. 이 모델은 문장이 완성될 때까지 기다리지 않고 텍스트가 들어오는 즉시 프레임 단위로 오디오를 생성하는 스트리밍 우선(Streaming-first) 방식을 채택했습니다.

주요 기술 사양 및 성능:

  • 모델 구조: Qwen3.5 0.8B 백본(14 레이어) 및 Nemo NanoCodec(FSQ, 22.05kHz) 기반의 약 555M 파라미터 규모 모델입니다.
  • 추론 속도: RTX 5090 환경에서 **20배의 실시간 계수(RTF)**와 **~50ms의 첫 오디오 생성 시간(TTFA)**을 기록했습니다.
  • 확장성: RTX Pro 6000 Blackwell(96GB VRAM) 한 장으로 최대 256개의 병렬 시퀀스를 처리할 수 있습니다.
  • 기능: 몇 초간의 참조 오디오만으로 가능한 Zero-shot 음성 복제를 지원하며, 영어, 스페인어, 포르투갈어, 네덜란드어를 지원합니다.

성능 평가: Seed-TTS-eval 벤치마크 결과, VoxCPM2, Fish-S2 등 기존 모델 대비 NISQA-MOS(4.25) 부문에서 최고 수준의 인지 품질을 보였으며, 노이즈 및 불연속성 측면에서 가장 깨끗한 음질을 구현했습니다. 다만, 스트리밍 최적화로 인해 화자 유사성(SIM 0.585)과 단어 오류율(WER 0.036)에서는 다소의 트레이드오프가 존재합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.