AI Briefing

NVIDIA, 에이전트용 오픈 데이터 공개

Data for Agents

·2026.07.09 02:16

NVIDIA가 에이전트 성능 향상을 위한 Nemotron 오픈 데이터셋과 시각화 도구를 공개했다.

NVIDIA는 AI 에이전트의 핵심 과제인 실제 환경에서의 복잡한 워크플로우 수행 능력을 해결하기 위해 Nemotron 오픈 데이터 제품군을 공개했습니다. 에이전트의 행동을 이해하고 재현하기 위해서는 모델 가중치뿐만 아니라 데이터의 투명성이 필수적이라는 점을 강조합니다.

주요 공개 내용은 다음과 같습니다:

  • Nemotron 오픈 데이터셋: 10조 개 이상의 프리트레이닝 토큰과 수백만 개의 포스트트레이닝 샘플을 포함하며, Nemotron-MATH(수학), Nemotron-CLIMB(코드) 등 특화된 합성 데이터(Synthetic Data)를 제공합니다.
  • Nemotron Post-Training v3 Prompt Atlas: 데이터의 구성을 직관적으로 파악할 수 있는 대화형 시각화 맵을 통해 코딩, 안전성, 수학, 에이전트 행동 등 도메인별 프롬프트 샘플을 탐색할 수 있습니다.
  • 합성 데이터의 역할: 기업의 기밀 데이터를 직접 노출하지 않으면서도 고품질의 신호를 학습에 활용할 수 있는 핵심 수단으로 제시되었습니다.

또한, 언어별 문화적 맥락(예: 한국어의 존댓말에 포함된 공격성 등)을 반영한 Nemotron-Personas를 통해 에이전트의 현지화된 데이터 품질 문제를 해결하려는 시도를 보여줍니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.