AI Briefing

NVIDIA Parakeet, ggml 포팅 완료

I ported NVIDIA Parakeet (speech-to-text) to ggml: same output as NeMo, faster, GGUF-quantized, no Python

·2026.06.01 05:35

NVIDIA의 Parakeet STT 모델을 Python 없이 C++/ggml 환경에서 실행할 수 있도록 포팅하여 성능과 효율성을 대폭 개선했다.

NVIDIA의 Parakeet 음성 인식(STT) 모델을 ggml 엔진(llama.cpp, whisper.cpp의 기반)으로 포팅하여, Python과 PyTorch 없이도 CPU 및 GPU(CUDA, Metal 등)에서 구동할 수 있게 되었다.

주요 성능 및 특징:

  • 정확도: NeMo 모델과 바이트 단위로 동일한 출력을 보장한다 (f32/f16 기준 WER 0).
  • 속도: GPU에서 대형 모델 기준 NeMo 대비 최대 5배, CPU 양자화 시 약 1.86배 빠르다.
  • 효율성: 메모리 사용량을 약 2배 절감했으며, GPU 기준 1시간 분량의 오디오를 약 6초 만에 처리(600x 실시간)한다.
  • 양자화: f16부터 q4_k까지 다양한 GGUF 양자화 형식을 지원한다.
  • 통합 및 편의성: 토크나이저가 포함된 self-contained GGUF 형식을 사용하며, LocalAI 백엔드로 탑재되어 OpenAI 호환 API를 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.