Wav2Vec2-BERT로 저자원 ASR 구현하기
Fine-Tune W2V2-Bert for low-resource ASR with 🤗 Transformers
·2024.01.19 09:00
Meta의 Wav2Vec2-BERT를 활용해 데이터가 부족한 언어의 음성 인식(ASR) 성능을 높이는 방법을 다룬다.
MetaAI가 공개한 Wav2Vec2-BERT는 143개 이상의 언어, 450만 시간의 미라벨링 오디오 데이터로 사전 학습된 5억 8천만 파라미터 규모의 범용 오디오 모델이다.
기존의 Whisper 모델은 영어 성능은 우수하지만, 몽골어와 같은 **저자원 언어(low-resource languages)**에서는 성능이 매우 낮고 자기회귀(autoregressive) 방식의 특성상 추론 속도가 느리다는 한계가 있다.
반면 Wav2Vec2-BERT는 단일 패스(single pass) 방식으로 음성을 예측하여 Whisper보다 훨씬 빠르며, 적은 양의 데이터로도 경쟁력 있는 성능을 낼 수 있다.
이 가이드는 CTC(Connectionist Temporal Classification) 알고리즘을 사용하여 몽골어 데이터셋(Common Voice 16.0)을 대상으로 모델을 미세 조정하는 전체 파이프라인과 효율적인 학습을 위한 전문가 팁을 제공한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.