Apple Research, 언어 구별 강화로 다국어 음성 모델 격차 축소
·2026.10.02 09:00
핵심 내용
Apple Research가 언어 구별 강화로 다국어 음성 모델의 성능 격차를 줄였다.
자세히 보기
데이터 예산이 동일한 조건에서 여러 언어를 공유하는 다국어 자기지도 음성 모델은 단일 언어 모델보다 성능이 떨어지는 경향이 있다. Apple Research는 사전 학습 단계에서 모델의 언어 구별 능력을 강화하면 음성 및 언어 지표에서의 격차가 줄어들면서도 언어 간 공유는 유지된다고 밝혔다.
개입 방법 및 결과
연구진은 통제된 영어/프랑스어 HuBERT 환경에서 보조 언어 분류기와 언어별 k-means 타겟이라는 두 가지 개입 방법을 테스트했다. 이 변경 사항은 주요 지표에서 상당한 개선을 가져왔다:
- **음소 구별 오류(phone-ABX)**는 이중 언어 기준선에서 11.6%에서 **10.4%**로 감소했다(단일 언어 모델은 10.8%).
- **어휘 성능(sWUGGY)**은 52.1%에서 **56.7%**로 상승했다(단일 언어 모델은 58.5%).
- **운율 성능(ProsAudit)**은 68.9%에서 **72.9%**로 증가했다(단일 언어 모델은 72.6%).
개입 시점
연구에 따르면 언어 구별을 HuBERT 학습의 첫 번째 반복 단계에서 도입했을 때 가장 큰 성능 향상이 나타났다. 이후 단계나 반복적인 개입은 개선 효과가 작았으며 언어별 분리 현상을 초래했다. 이러한 결과는 다국어 학습 비용을 줄이는 데 언어 구별이 인과적 역할을 한다는 점을 뒷받침한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.