AI Briefing

양자화가 역효과

I benchmarked 30+ TTS engines for a real-time translator on Apple M4. Quantization made things SLOWER. Here's all the data.

·2026.04.15 23:01

핵심 내용

MacBook Air M4에서 TTS 엔진 30개를 돌려보니 Kokoro가 최적, 양자화는 오히려 느렸다.

자세히 보기

실시간 번역 파이프라인에서 TTS가 병목이었다. Deepgram Nova-3 STT가 약 300ms, Groq Llama 3.3 70B 번역이 약 200ms로 합계 500ms 수준이었지만, TTS가 1초만 넘어가도 대화감이 무너졌다.

로컬 TTS를 MacBook Air M4, 24GB RAM에서 같은 문장으로 비교한 결과:

  • Piper ryan-med: 30~50ms(2~3단어), 137ms(10단어)로 가장 빠르지만 품질은 B
  • Kokoro 82M fp16: 370ms(2~3단어), 730ms(10단어), 품질 **A+**로 가장 균형이 좋았음
  • pocket-tts: 260ms / 7500ms로 짧은 문장 외에는 비실용적
  • ZipVoice 123M: 약 500ms / 1240ms, 품질 B+
  • Chatterbox 500M: 6310ms / 9100ms, 품질 A지만 실시간 용도에는 너무 느림
  • Qwen3-TTS 0.6B: 약 800ms / 1600~2000ms
  • Qwen3-TTS 1.7B: 약 2500ms / 5300ms

결론은 200M 파라미터를 넘으면 Mac에서 실시간 TTS로 쓰기 어렵다는 것. 속도와 품질의 최적점은 Kokoro 82M이었다.

가장 의외였던 부분은 양자화가 느려진 것이다.

  • fp16 기본값: 373ms로 가장 빨랐음
  • INT8: 687ms로 약 1.8배 느려짐
  • q8f16: 655ms로 약 1.75배 느려짐
  • CoreML Neural Engine: 아키텍처 미지원 에러
  • 스레드 4개: 약 730ms로 최적
  • 1개 스레드: 1723ms
  • 8개 스레드: 754ms, 오히려 오버헤드가 생김

작성자는 Apple Silicon이 fp16 연산에 최적화되어 있어, INT8 같은 양자화가 메모리는 줄여도 타입 변환 비용 때문에 느려질 수 있다고 정리했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.