전용 모델을 통한 ASR 오류 수정 방식의 재조명
·2026.07.06 09:00
LLM보다 가벼운 seq2seq 모델을 활용해 ASR 오류 수정의 효율성과 정확도를 높이는 방법을 제안한다.
기존의 ASR(자동 음성 인식) 오류 수정 방식은 대부분 ASR의 오류 패턴을 인지하지 못하는 텍스트 전용 모델에 의존해 왔다. 최근에는 LLM을 적용하려는 시도가 있으나, 높은 지연 시간(Latency)과 환각(Hallucination) 문제가 한계로 지적된다.
본 연구에서는 실제 및 합성 오디오에서 추출한 오류 데이터를 학습한 compact seq2seq 모델을 통해 이 문제를 해결한다. 학습 규모를 확장하기 위해 TTS와 ASR을 결합한 캐스케이드 방식을 통해 합성 코퍼스를 구축했으며, 실제 오류 분포의 다양성을 맞추는 것이 핵심임을 확인했다.
새롭게 제안하는 Correction-first decoding 방식은 수정 모델이 후보군을 생성하면 ASR의 음향 점수(Acoustic scores)를 사용하여 재점수화(Rescoring)한다.
주요 성과는 다음과 같다:
- 효율성: LLM 대비 파라미터 수를 15배 적게 사용하면서도 우수한 성능 구현
- 정확도: LibriSpeech test-clean/other 기준 1.5/3.3% WER 달성 (LLM 대비 우세)
- 범용성: CTC, Seq2seq, Transducer 등 다양한 ASR 아키텍처와 도메인에서 일반화 성능 입증
- 정밀도: LLM이 취약한 저오류(Low-error) 영역에서 더욱 정밀한 수정 가능
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.