AI Briefing

NVIDIA Nemotron-Personas-Korea - 대한민국 실제 인구 분포를 기반으로 한 100만 건 합성 페르소나 데이터셋

·2026.04.27 09:46

핵심 내용

NVIDIA가 한국 인구 분포를 반영한 100만 건 합성 페르소나 데이터셋을 공개했다.

자세히 보기

NVIDIA가 Nemotron-Personas-Korea를 공개했다. 대한민국의 실제 인구통계·지리·성향 분포를 반영한 합성 페르소나 데이터셋으로, 한국어로 읽기 쉽게 구성된 것이 특징이다.

  • 100만 건 레코드, 700만 개 페르소나, 26개 필드로 구성됐다.
  • 이름, 성별, 나이, 혼인 상태, 교육 수준, 직업, 거주 지역 등 다양한 속성을 담았다.
  • KOSIS, 대법원, 국민건강보험공단, 농촌경제연구원 등 공공 데이터를 기반으로 만들었다.
  • NeMo Data Designer와 google/gemma-4-31B-it를 사용해 합성했고, CC BY 4.0으로 공개됐다.

기존 LLM이 생성하는 한국 페르소나는 음식 선호, 직업 분포, 지역 분포 등이 현실과 크게 어긋난다는 점도 함께 지적했다. 예시로는 샐러드 선호 과다, 특정 직업으로의 극단적 쏠림 같은 편향이 제시됐다.

이 데이터셋은 이런 편향을 줄이기 위해 설계됐다. 특히 고령층, 농촌 지역, 학력·직업 분포를 더 충실히 반영하도록 구성했고, 소버린 AI 모델의 학습·평가용 합성 데이터로 활용할 수 있다고 설명했다.

세부적으로는:

  • 17개 시도, 252개 시군구를 포함했다.
  • 20만 9천여 개의 고유 성명 조합을 반영했다.
  • 연령, 혼인, 가구 형태, 학력, 직업 분포가 실제 통계와 유사하게 나타난다고 소개했다.
  • 온라인 쇼핑 판매원, 건물 경비원, 건물 청소원 등 한국 노동시장 특성도 반영했다.

또한 이 데이터셋은 LLM 기반 합성 페르소나보다 도시·가구·주거·음식 분포에서 현실성이 높다고 주장했다. 이름 분포는 1940년대부터의 세대별 작명 경향을 반영해 시대착오적인 조합을 줄였다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.