AI Briefing

HuggingFace, 인도 다언어 데이터셋 Vaani 지원

HuggingFace, IISc partner to supercharge model building on India's diverse languages

·2025.02.27 09:00

HuggingFace가 IISc와 협력하여 인도의 다양한 언어와 방언을 포함한 대규모 멀티모달 데이터셋 Vaani를 공개했다.

HuggingFace와 인도 과학원(IISc), ARTPARK가 파트너십을 맺고 인도의 언어적 다양성을 반영한 오픈소스 멀티모달 데이터셋인 Vaani의 접근성을 높이고 활용도를 개선한다.

Vaani 데이터셋 주요 특징:

  • 방대한 규모: 인도 전역 773개 지역의 방언과 언어를 포괄하며, 최종적으로 15만 시간 이상의 음성 데이터1.5만 시간의 전사(transcribed) 텍스트 데이터 수집을 목표로 한다.
  • 지리 중심적 접근: 주류 언어에만 집중하지 않고 소외된 지역의 방언까지 포함하여 데이터의 다양성을 확보했다.
  • 단계적 공개: 현재 80개 지역을 포함한 1단계 데이터가 오픈소스로 공개되었으며, 100개 지역을 추가하는 2단계 작업이 진행 중이다.

주요 활용 분야:

  • 음성 기술: 음성 인식(ASR), 음성 합성(TTS), 화자 식별(Speaker ID), 언어 식별(Language ID) 모델 학습 및 미세 조정.
  • 파운데이션 모델: 인도 언어 특화 파운데이션 음성 모델 개발.
  • 멀티모달 LLM: 멀티모달 데이터와의 결합을 통한 LLM의 멀티모달 능력 향상 및 성능 벤치마킹.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.