NVIDIA 음성 스택 로컬화
🟩 NVIDIA's whole speech stack just went local. ASR + TTS + codec, quantized to GGUF, running on-device via NeMo-Speech.cpp
·2026.08.07 07:54
핵심 내용
NVIDIA가 ASR·TTS·음성 코덱을 GGUF로 양자화해 온디바이스 실행을 지원한다.
자세히 보기
NVIDIA의 NeMo-Speech.cpp를 통해 음성 인식(ASR), 음성 합성(TTS), 음성 코덱을 로컬 환경에서 실행할 수 있게 됐다.
지원 모델과 구성 요소는 다음과 같다.
- Magpie-TTS Multilingual
- Nemotron Speech Streaming EN 0.6B
- Nemotron-3.5 ASR Streaming
- Parakeet CTC 1.1B
- Parakeet TDT 0.6B v3
- NanoCodec
모델은 GGUF 형식으로 양자화됐으며, Hugging Face 모델 카드에서 NeMo-Speech.cpp를 활용한 로컬 실행 방법을 제공한다. NanoCodec 지원도 프로젝트에 병합됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.