AI Briefing

텍스트-음성 변환 모델이 50ms 미만으로 응답하도록 만든 방법

·2026.08.22 00:51

핵심 내용

Qwen3-TTS를 최적화해 단일 H100에서 50ms 미만 지연과 10 RPS 처리 성능을 달성했다.

자세히 보기

Qwen3-TTS 1.7B CustomVoice 구현을 통해 단일 NVIDIA H100 SXM에서 10 RPS 처리량과 **50ms 미만 p95 TTFA(Time-To-First-Audio)**를 달성했다. 이는 ElevenLabs V3($100/1M chars)나 Cartesia Sonic 3.5($49/1M chars) 대비 약 $2/1M chars의 비용 효율성을 제공한다.

기존 vLLM-Omni, SGLang-Omni, VoxServe 등 5가지 엔진을 비교한 결과, 해당 구현체만이 저지연 스트리밍 튜닝 후 50ms 미만 p95 TTFA를 유지했다. 20 RPS에서도 100ms 미만 지연을 유지하며, 10 RPS 기준 초당 약 630자 생성 성능을 보였다.

주요 최적화 기법은 다음과 같다.

  • 리딩 실리언스 제거: 초기 PCM의 무음 구간을 동적으로 트리밍하여 지연을 약 80ms 단축
  • 프레임 누적 튜닝: 초기 작은 청크로 TTFA를 낮추고 이후 청크 크기를 늘려 재생 연속성 확보
  • 통합 스케줄러: Talker, Code Predictor, Causal Codec 등 3개 모듈을 단일 스케줄러로 통합하여 이질적인 작업 간 조정 최적화

해당 구현체와 벤치마크 코드는 오픈소스로 공개되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.