Inflect-Micro-v2: 9.36M 파라미터로 구현한 완전한 음성 모델
·2026.07.26 09:36
1,000만 개 미만의 파라미터로 로컬 실행이 가능한 고효율 TTS 모델 Inflect-Micro-v2가 공개되었습니다.
텍스트를 웨이브폼으로 변환하는 완전한 로컬 TTS(Text-to-Speech) 모델인 Inflect-Micro-v2가 출시되었습니다. 이 모델은 **9.36M(약 936만 개)**의 파라미터만을 사용하여 높은 효율성을 자랑합니다.
주요 특징은 다음과 같습니다:
- 두 가지 사이즈 제공: 품질에 집중한 Micro(10M 미만) 모델과 크기에 집중한 Nano(4M 미만) 모델로 구성됩니다.
- 효율적인 추론: CPU 및 CUDA 환경 모두에서 추론이 가능하며, 24 kHz mono 출력을 지원합니다.
- 제어 기능: 결정론적 시드(Deterministic seeds)를 통한 고정된 목소리 구현과 긴 텍스트 처리 기능을 갖추고 있습니다.
- 경량화: 모델 크기는 FP32 기준 약 37.53 MB로 매우 가볍습니다.
이 모델은 고성능 서버 없이도 로컬 환경에서 안정적인 음성 합성을 구현하려는 개발자들에게 적합한 솔루션입니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.