AI Briefing

mms-300m: 1,400개 언어 음성 데이터로 학습한 300M 파라미터 음성 모델

facebook/mms-300m

·2026.09.04 02:23

약 50만 시간 분량의 음성 데이터를 1,400개 이상의 언어로 사전 학습한 wav2vec2 기반 모델이다. 3억 개의 파라미터를 통해 다양한 언어 환경에서 음성 인식을 수행할 수 있는 기반을 제공한다.

완성된 추론 모델이 아닌 미세 조정을 위한 사전 학습 가중치다. 자동 음성 인식, 번역, 분류 등 특정 작업에 맞춰 추가 학습을 진행해야 실제 서비스에서 활용할 수 있다. 입력 음성 데이터는 반드시 16kHz 샘플링 레이트를 준수해야 한다.

지원 언어 범위가 넓어 소수 언어나 다국어 환경의 음성 처리 파이프라인 구축에 적합하다. CC-BY-NC 4.0 라이선스를 따르므로 상업적 이용 제한을 확인해야 하며, 연구 및 비영리 목적의 음성 기술 개발에 주로 활용된다.

HuggingFace
HuggingFace 모델

facebook/mms-300m

원문에 등록된 설명이 없습니다.

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.