양자화가 역효과
I benchmarked 30+ TTS engines for a real-time translator on Apple M4. Quantization made things SLOWER. Here's all the data.
·2026.04.15 23:01
핵심 내용
MacBook Air M4에서 TTS 엔진 30개를 돌려보니 Kokoro가 최적, 양자화는 오히려 느렸다.
자세히 보기
실시간 번역 파이프라인에서 TTS가 병목이었다. Deepgram Nova-3 STT가 약 300ms, Groq Llama 3.3 70B 번역이 약 200ms로 합계 500ms 수준이었지만, TTS가 1초만 넘어가도 대화감이 무너졌다.
로컬 TTS를 MacBook Air M4, 24GB RAM에서 같은 문장으로 비교한 결과:
- Piper ryan-med: 30~50ms(2~3단어), 137ms(10단어)로 가장 빠르지만 품질은 B
- Kokoro 82M fp16: 370ms(2~3단어), 730ms(10단어), 품질 **A+**로 가장 균형이 좋았음
- pocket-tts: 260ms / 7500ms로 짧은 문장 외에는 비실용적
- ZipVoice 123M: 약 500ms / 1240ms, 품질 B+
- Chatterbox 500M: 6310ms / 9100ms, 품질 A지만 실시간 용도에는 너무 느림
- Qwen3-TTS 0.6B: 약 800ms / 1600~2000ms
- Qwen3-TTS 1.7B: 약 2500ms / 5300ms
결론은 200M 파라미터를 넘으면 Mac에서 실시간 TTS로 쓰기 어렵다는 것. 속도와 품질의 최적점은 Kokoro 82M이었다.
가장 의외였던 부분은 양자화가 느려진 것이다.
- fp16 기본값: 373ms로 가장 빨랐음
- INT8: 687ms로 약 1.8배 느려짐
- q8f16: 655ms로 약 1.75배 느려짐
- CoreML Neural Engine: 아키텍처 미지원 에러
- 스레드 4개: 약 730ms로 최적
- 1개 스레드: 1723ms
- 8개 스레드: 754ms, 오히려 오버헤드가 생김
작성자는 Apple Silicon이 fp16 연산에 최적화되어 있어, INT8 같은 양자화가 메모리는 줄여도 타입 변환 비용 때문에 느려질 수 있다고 정리했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.