NVIDIA Nemotron-Personas-Korea - 대한민국 실제 인구 분포를 기반으로 한 100만 건 합성 페르소나 데이터셋
·2026.04.27 09:46
NVIDIA가 한국 인구 분포를 반영한 100만 건 합성 페르소나 데이터셋을 공개했다.
NVIDIA가 Nemotron-Personas-Korea를 공개했다. 대한민국의 실제 인구통계·지리·성향 분포를 반영한 합성 페르소나 데이터셋으로, 한국어로 읽기 쉽게 구성된 것이 특징이다.
- 100만 건 레코드, 700만 개 페르소나, 26개 필드로 구성됐다.
- 이름, 성별, 나이, 혼인 상태, 교육 수준, 직업, 거주 지역 등 다양한 속성을 담았다.
- KOSIS, 대법원, 국민건강보험공단, 농촌경제연구원 등 공공 데이터를 기반으로 만들었다.
- NeMo Data Designer와 google/gemma-4-31B-it를 사용해 합성했고, CC BY 4.0으로 공개됐다.
기존 LLM이 생성하는 한국 페르소나는 음식 선호, 직업 분포, 지역 분포 등이 현실과 크게 어긋난다는 점도 함께 지적했다. 예시로는 샐러드 선호 과다, 특정 직업으로의 극단적 쏠림 같은 편향이 제시됐다.
이 데이터셋은 이런 편향을 줄이기 위해 설계됐다. 특히 고령층, 농촌 지역, 학력·직업 분포를 더 충실히 반영하도록 구성했고, 소버린 AI 모델의 학습·평가용 합성 데이터로 활용할 수 있다고 설명했다.
세부적으로는:
- 17개 시도, 252개 시군구를 포함했다.
- 20만 9천여 개의 고유 성명 조합을 반영했다.
- 연령, 혼인, 가구 형태, 학력, 직업 분포가 실제 통계와 유사하게 나타난다고 소개했다.
- 온라인 쇼핑 판매원, 건물 경비원, 건물 청소원 등 한국 노동시장 특성도 반영했다.
또한 이 데이터셋은 LLM 기반 합성 페르소나보다 도시·가구·주거·음식 분포에서 현실성이 높다고 주장했다. 이름 분포는 1940년대부터의 세대별 작명 경향을 반영해 시대착오적인 조합을 줄였다고 밝혔다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.