AI Briefing

Nemotron 합성 데이터 생성 기법 공개

Task-Seeded Synthetic Q&A Generation for Nemotron Pretraining

·2026.06.04 20:24

기존 태스크를 시드로 활용해 고품질 합성 데이터를 생성함으로써 Nemotron 모델의 성능을 향상시킨다.

대규모 언어 모델(LLM) 개발에서 데이터의 양만큼 중요한 것은 데이터에 포함된 구조화된 학습 신호입니다. Nemotron 개발팀은 일반적인 웹 데이터 외에, 특정 태스크에 최적화된 Task-seeded Synthetic Q&A Generation (SDG) 워크플로우를 도입하여 모델의 성능을 끌어올렸습니다.

이 방식은 lm-eval-harness의 공개 태스크 학습 분할을 **능력 시드(capability seeds)**로 활용합니다. 단순히 데이터를 암기하는 것이 아니라, 시드 태스크로부터 유사한 질문을 생성하고, 답변에 **추론 과정(reasoning)**과 **관련 지식(context)**을 풍부하게 결합하여 새로운 예시를 만들어냅니다.

주요 파이프라인 특징:

  • 시드 구성: 약 70개의 태스크(700개 하위 태스크)를 활용하며, 지식 집약적 태스크(3M 샘플)와 추론 집약적 태스크(1.5M 샘플)를 모두 포함합니다.
  • 데이터 강화: 단순 Q&A를 넘어 추론 경로(reasoning traces)와 태스크 관련 문맥을 포함한 풍부한 데이터를 생성합니다.
  • 엄격한 검증: 스키마 및 포맷 체크, 중복 제거, 다수결 투표(majority vote) 기반의 답변 검증을 거칩니다.

Nemotron-3 Nano 모델(100B 토큰 추가 학습) 실험 결과:

  • GPQA: +11.1
  • Code: +1.9
  • MMLU-Pro: +1.8
  • Commonsense: +1.6
  • Math: 성능 유지

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.