소말리 음성모델
Anyone working on TTS/ASR for low-resource African or Cushitic languages?
·2026.04.17 06:14
핵심 내용
소말리 TTS는 XTTS V4가 가장 낫지만, LLM·Whisper가 병목이다.
자세히 보기
소말리어는 약 2,500만 명이 쓰지만, 아직 ElevenLabs나 Cartesia 같은 상용 서비스에서 생산용 지원이 없다.
직접 실험한 결과는 다음과 같다.
- MMS-TTS (facebook/mms-tts-som): 동작하는 기준선이지만 품질은 아쉽다.
- Fish Speech V1.5 LoRA: 가능성은 있었지만 발음이 충분히 깔끔하지 않았다.
- XTTS V4: 현재까지 가장 좋은 결과를 냈고, 약 300시간의 소말리 음성 데이터로 235K steps까지 학습했다.
가장 큰 이슈는 토크나이저에 [so] 토큰이 없다는 점이다. 소말리어가 라틴 문자를 쓰기 때문에 [en] 토큰으로 우회했다.
TTS 발음은 점점 개선되고 있지만, 더 어려운 문제는 LLM 계층이다. 대부분의 모델이 소말리 텍스트를 거의 보지 못해 이해와 자연스러운 응답 생성이 약하다. Whisper도 소말리 전사 정확도가 낮다.
결국 소말리, 암하라어, 티그리냐어 같은 저자원 아프리카 언어에서 실제로 무엇이 잘 작동하는지 경험을 공유해 달라는 요청이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.