온디바이스 ASR 성능 개선
Are on-device ASRs getting much better?
·2026.04.22 08:05
핵심 내용
온디바이스 스트리밍 ASR이 CPU에서 **8.20% WER**와 **0.56초** 지연을 기록했다.
자세히 보기
CPU 전용 환경에서 온디바이스 스트리밍 ASR의 정확도, 지연, 메모리 절충점을 밀어 올렸다.
- 50개 이상 구성을 Whisper, Nemotron, Parakeet TDT, Canary, Conformer Transducer, Qwen3-ASR 등에 걸쳐 batch, chunked, streaming 모드로 비교했다.
- 그 결과 NVIDIA Nemotron Speech Streaming이 실시간 영어 스트리밍에 가장 유력한 후보로 꼽혔다.
파이프라인은 ONNX Runtime으로 재구현됐고, 중요도 가중 k-quant, 혼합 정밀도, round-to-nearest 양자화, 그래프 수준 오퍼레이터 퓨전이 적용됐다.
모델 크기는 2.47GB → 0.67GB로 줄었고, full-precision PyTorch 대비 WER는 절대 1% 이내를 유지했다.
권장 구성인 int4 k-quant는 8개 표준 벤치마크 평균 8.20% streaming WER와 0.56초 알고리즘 지연을 기록해, CPU에서 실시간보다 빠른 새 품질-효율 지점을 제시했다.
원문: https://arxiv.org/abs/2604.14493
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.