NVIDIA, 인도 맞춤형 합성 데이터셋 공개
Nemotron-Personas-India: Synthesized Data for Sovereign AI
·2025.10.14 08:00
NVIDIA가 인도의 문화적, 언어적 특성을 반영한 2,100만 명 규모의 합성 페르소나 데이터셋을 공개했다.
NVIDIA가 인도의 다언어 및 다문화 환경을 지원하기 위해 Nemotron-Personas-India 데이터셋을 출시했다. 이 데이터셋은 서구권 중심의 데이터 편향을 극복하고 인도의 실제 인구 통계와 문화적 맥락을 반영하도록 설계되었다.
주요 특징:
- 2,100만 명의 페르소나 (총 77억 토큰 규모)
- 다언어 지원: 영어 및 힌디어(Devanagari 및 Latin 스크립트) 지원
- 상세 속성: 연령, 성별, 교육 수준, 직업, 거주 지역(36개 주 및 640개 지역) 등 27개 필드 포함
- 라이선스: CC BY 4.0으로 상업적 이용 가능
데이터 생성 방식: NVIDIA의 NeMo Data Designer를 활용한 복합 AI 시스템으로 구축되었으며, 통계적 근거를 위해 확률적 그래픽 모델(Probabilistic Graphical Model)과 GPT-OSS-120B 모델을 사용했다.
이 데이터셋은 인도의 다양한 사회적 배경을 반영하여 다언어 챗봇이나 문화적 맥락을 이해하는 전문 AI 코파일럿을 개발하는 데 최적화되어 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.