AI Briefing

XLS-R 기반 다국어 ASR 미세 조정 가이드

Fine-Tune XLSR-Wav2Vec2 for low-resource ASR with 🤗 Transformers

·2021.11.15 09:00

Hugging Face의 XLS-R 모델을 활용해 저자원 언어의 음성 인식(ASR) 성능을 높이는 미세 조정 방법을 설명한다.

XLS-R은 Facebook AI가 발표한 Wav2Vec2의 후속 모델로, 128개 언어의 약 50만 시간 분량의 오디오 데이터를 사용하여 자기 지도 학습을 거쳤다.

모델 크기는 300M에서 2B 파라미터까지 다양하며, 오디오 특징 벡터를 무작위로 마스킹하여 문맥화된 음성 표현을 학습하는 방식을 사용한다.

본 가이드는 Common Voice 데이터셋을 활용해 XLS-R 모델을 CTC(Connectionist Temporal Classification) 알고리즘 기반의 음성 인식(ASR) 작업에 미세 조정하는 과정을 단계별로 안내한다.

transformerstorchaudio 등 Hugging Face 라이브러리를 사용하여 저자원 환경에서도 효과적인 다국어 음성 인식을 구현하는 방법을 다룬다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.