단어 오류율(WER)의 이해
단어 오류율(WER)은 음성 인식(ASR) 모델의 정확도를 측정하는 핵심 지표로, 삽입, 삭제, 교체 오류를 통해 성능을 평가한다.
단어 오류율(WER, Word Error Rate)은 음성 인식(ASR) 도구의 정확도를 결정하는 표준 지표다. WER 수치가 낮을수록 전사(Transcription) 결과가 더 정확함을 의미하며, 수치가 높을수록 정보가 잘못 기록되었음을 나타낸다.
WER은 세 가지 오류 유형을 기준으로 계산된다:
- Substitution (교체): 단어가 잘못된 다른 단어로 바뀐 경우
- Deletion (삭제): 단어가 완전히 누락된 경우
- Insertion (삽입): 말하지 않은 단어가 추가된 경우
계산 공식은 WER = (S + D + I) / N이며, 여기서 N은 정답 텍스트의 총 단어 수다. 실무적으로 5% 미만의 WER은 우수한 성능의 벤치마크로 간주되지만, 의료나 법률 분야에서는 이보다 더 낮은 오류율이 요구된다.
WER은 모델 간의 성능을 객적으로 비교할 수 있는 근거를 제공한다. 최근 Artificial Analysis의 연구에 따르면, ElevenLabs의 Scribe v2는 AA-AgentTalk 데이터셋 기준 **1.5%**의 WER을 기록하며 업계 최저 수준의 정확도를 보였다.
다만, WER은 모든 오류를 동일하게 취급하므로 문맥적 의미를 완벽히 반영하지 못한다는 한계가 있다. 이를 보완하기 위해 발화의 의미 보존 여부를 측정하는 SWER(Semantic Word Error Rate) 같은 새로운 지표들도 등장하고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.