AI Briefing

ASR 테스트용 noisekit 공개

noisekit - CLI for generating realistic degraded speech datasets for ASR benchmarking [P]

·2026.05.27 22:06

깨끗한 음성 데이터를 실제 통화 환경과 유사한 노이즈 데이터로 변환해 ASR 성능을 테스트하는 CLI 도구입니다.

ASR(자동 음성 인식) 모델을 실제 환경에서 테스트할 때, 깨끗한 데이터셋(FLEURS, CommonVoice 등)과 실제 노이즈가 섞인 운영 환경 사이의 간극을 메우기 위한 도구입니다.

noisekit은 기존의 주석(annotation)이 달린 깨끗한 데이터셋에 다양한 열화(degradation)를 적용하여, 동일한 주석을 유지한 채 노이즈가 포함된 데이터셋을 생성합니다. 이를 통해 별도의 추가 라벨링 없이도 다양한 환경에서의 **WER(Word Error Rate)**을 즉시 계산할 수 있습니다.

주요 제공 기능:

  • telecom: G.711 협대역, 8-bit BitCrush, 저비트레이트 MP3를 적용해 실제 전화 통화 환경 구현
  • noise: MUSAN 등을 활용한 주변 소음(ambient noise) 혼합
  • reverb: 원거리 마이크 환경을 모사한 잔향 효과
  • low_bitrate / clipping: 저비트레이트 압축 및 마이크 포화 현상 재현

결과물은 HuggingFace AudioFolder 형식과 호환되어 즉시 데이터셋으로 로드할 수 있으며, metadata.jsonl을 통해 PESQ, SNR, NISQA 점수를 함께 제공하여 품질 상관관계를 분석할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.