MMS 어댑터로 저자원 언어 ASR 성능 극대화
Fine-Tune MMS Adapter Models for low-resource ASR
·2023.06.19 09:00
Meta의 MMS 모델을 어댑터 방식으로 미세 조정하여 저자원 언어의 ASR 성능을 효율적으로 높이는 방법을 소개한다.
Meta AI의 Massive Multilingual Speech (MMS) 모델을 활용하여 저자원 언어(low-resource languages)의 자동 음성 인식(ASR) 성능을 최적화하는 Adapter training 방법을 다룬다.
기존의 전체 모델 미세 조정(Full fine-tuning) 방식과 달리, 어댑터 방식은 모델의 극히 일부 가중치(약 2.5M개)만을 학습시킨다. 이는 다음과 같은 장점을 제공한다:
- 메모리 효율성: 전체 모델을 학습시키는 것보다 훨씬 적은 자원으로 학습 가능
- 강건성 및 성능: 저자원 언어에서 더 높은 성능과 안정적인 결과 도출
- 빠른 학습: 단 10~20분의 미세 조정만으로도 놀라운 단어 오류율(WER) 달성 가능
MMS는 1,400개 이상의 언어, 50만 시간 이상의 오디오로 사전 학습되었으며, 300M 및 1B 파라미터 크기의 체크포인트를 제공한다. 어댑터 레이어는 언어 간의 지식을 연결하는 '언어적 가교' 역할을 하여, 다양한 언어의 어휘를 효과적으로 수용한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.