XLS-R 기반 다국어 ASR 미세 조정 가이드
Fine-Tune XLSR-Wav2Vec2 for low-resource ASR with 🤗 Transformers
·2021.11.15 09:00
핵심 내용
Hugging Face의 XLS-R 모델을 활용해 저자원 언어의 음성 인식(ASR) 성능을 높이는 미세 조정 방법을 설명한다.
자세히 보기
XLS-R은 Facebook AI가 발표한 Wav2Vec2의 후속 모델로, 128개 언어의 약 50만 시간 분량의 오디오 데이터를 사용하여 자기 지도 학습을 거쳤다.
모델 크기는 300M에서 2B 파라미터까지 다양하며, 오디오 특징 벡터를 무작위로 마스킹하여 문맥화된 음성 표현을 학습하는 방식을 사용한다.
본 가이드는 Common Voice 데이터셋을 활용해 XLS-R 모델을 CTC(Connectionist Temporal Classification) 알고리즘 기반의 음성 인식(ASR) 작업에 미세 조정하는 과정을 단계별로 안내한다.
transformers와 torchaudio 등 Hugging Face 라이브러리를 사용하여 저자원 환경에서도 효과적인 다국어 음성 인식을 구현하는 방법을 다룬다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.