AI Briefing

Hugging Face, 자연어 기반 Synthetic Data Generator 공개

Introducing the Synthetic Data Generator - Build Datasets with Natural Language

·2024.12.16 09:00

자연어 설명만으로 맞춤형 데이터셋을 생성할 수 있는 노코드 도구, Synthetic Data Generator가 공개되었다.

자연어 설명을 통해 맞춤형 데이터셋을 구축할 수 있는 노코드 애플리케이션, Synthetic Data Generator가 출시되었다. 이 도구는 distilabelHugging Face text-generation API를 기반으로 작동하며, 복잡한 코딩 없이도 몇 분 만에 데이터셋을 생성할 수 있도록 지원한다.

현재 지원되는 주요 작업은 다음과 같다:

  • Text Classification: 고객 리뷰나 뉴스 기사 등을 분류하기 위한 데이터셋 생성. 텍스트 생성 후 레이블을 추가하는 과정을 거친다.
  • Chat Datasets: 대화형 LLM을 위한 지도 미세 조정(SFT)용 데이터셋 생성.

사용자는 데이터셋의 목적을 상세히 기술한 후, 생성된 system prompt를 조정하여 결과를 정교화할 수 있다. 최종 생성된 데이터셋은 ArgillaHugging Face Hub에 직접 업로드되어 즉시 활용 가능하다. 기본적으로 무료 API를 통해 샘플을 생성할 수 있으며, 사용자 설정에 따라 커스텀 모델이나 API 제공업체를 사용하여 확장할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.