AI Briefing

MMS 어댑터로 저자원 언어 ASR 성능 극대화

Fine-Tune MMS Adapter Models for low-resource ASR

·2023.06.19 09:00

Meta의 MMS 모델을 어댑터 방식으로 미세 조정하여 저자원 언어의 ASR 성능을 효율적으로 높이는 방법을 소개한다.

Meta AI의 Massive Multilingual Speech (MMS) 모델을 활용하여 저자원 언어(low-resource languages)의 자동 음성 인식(ASR) 성능을 최적화하는 Adapter training 방법을 다룬다.

기존의 전체 모델 미세 조정(Full fine-tuning) 방식과 달리, 어댑터 방식은 모델의 극히 일부 가중치(약 2.5M개)만을 학습시킨다. 이는 다음과 같은 장점을 제공한다:

  • 메모리 효율성: 전체 모델을 학습시키는 것보다 훨씬 적은 자원으로 학습 가능
  • 강건성 및 성능: 저자원 언어에서 더 높은 성능과 안정적인 결과 도출
  • 빠른 학습: 단 10~20분의 미세 조정만으로도 놀라운 단어 오류율(WER) 달성 가능

MMS는 1,400개 이상의 언어, 50만 시간 이상의 오디오로 사전 학습되었으며, 300M1B 파라미터 크기의 체크포인트를 제공한다. 어댑터 레이어는 언어 간의 지식을 연결하는 '언어적 가교' 역할을 하여, 다양한 언어의 어휘를 효과적으로 수용한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.