AI Briefing

Whisper 다국어 ASR 미세 조정 가이드

Fine-Tune Whisper For Multilingual ASR with 🤗 Transformers

·2022.11.03 09:00

Hugging Face Transformers를 사용하여 Whisper 모델을 다국어 음성 인식(ASR) 데이터셋으로 미세 조정하는 방법을 안내한다.

OpenAI의 Whisper는 68만 시간의 라벨링된 데이터를 사전 학습하여 96개 이상의 언어에서 뛰어난 성능을 보이는 음성 인식(ASR) 모델이다.

Hugging Face Transformers 라이브러리를 사용하여 Whisper를 특정 다국어 데이터셋에 맞춰 미세 조정(Fine-tuning)하는 전 과정을 단계별로 제공한다.

주요 단계 및 내용:

  • 환경 준비 및 데이터 로드: Common Voice와 같은 데이터셋을 불러오고 학습 환경을 설정한다.
  • 데이터 전처리: Feature Extractor와 Tokenizer를 사용하여 오디오 데이터를 모델 입력 형식으로 변환한다.
  • 모델 아키텍처: Transformer 기반의 Encoder-Decoder 구조를 통해 오디오 스펙트로그램을 텍스트 토큰으로 변환하는 과정을 설명한다.
  • 학습 및 평가: Google Colab에서 즉시 실행 가능한 코드를 통해 실제 미세 조정 및 성능 평가 과정을 수행한다.

Whisper는 이미 대규모의 지도 학습(Supervised Learning)을 거쳤기 때문에, 적은 양의 데이터로도 특정 언어나 도메인에 최적화된 고성능 ASR 모델을 구축할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.