AI Briefing

NVIDIA 음성 스택 로컬화

🟩 NVIDIA's whole speech stack just went local. ASR + TTS + codec, quantized to GGUF, running on-device via NeMo-Speech.cpp

·2026.08.07 07:54

핵심 내용

NVIDIA가 ASR·TTS·음성 코덱을 GGUF로 양자화해 온디바이스 실행을 지원한다.

자세히 보기

NVIDIA의 NeMo-Speech.cpp를 통해 음성 인식(ASR), 음성 합성(TTS), 음성 코덱을 로컬 환경에서 실행할 수 있게 됐다.

지원 모델과 구성 요소는 다음과 같다.

  • Magpie-TTS Multilingual
  • Nemotron Speech Streaming EN 0.6B
  • Nemotron-3.5 ASR Streaming
  • Parakeet CTC 1.1B
  • Parakeet TDT 0.6B v3
  • NanoCodec

모델은 GGUF 형식으로 양자화됐으며, Hugging Face 모델 카드에서 NeMo-Speech.cpp를 활용한 로컬 실행 방법을 제공한다. NanoCodec 지원도 프로젝트에 병합됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.