AI Briefing

Hugging Face, 오픈소스 데이터셋 성과 발표

Data Is Better Together: A Look Back and Forward

·2024.06.20 09:00

Hugging Face가 협업 프로젝트 'Data Is Better Together'의 데이터셋 구축 성과와 향후 계획을 공개했다.

Hugging Face와 Argilla가 협업하는 Data Is Better Together (DIBT) 이니셔티브의 주요 성과와 향후 로드맵을 발표했다.

주요 성과

  • Prompt Ranking 프로젝트: 1만 개의 프롬프트 품질 순위가 포함된 DIBT/10k_prompts_ranked 데이터셋을 출시했다. 이 데이터셋은 SPIN과 같은 새로운 모델 구축에 활용되고 있다.
  • Multilingual Prompt Evaluation Project (MPEP): 영어 중심의 데이터 편향을 해결하기 위해 다국어 프롬프트 평가 벤치마크를 개발 중이다. 현재 네덜란드어, 러시아어, 스페인어 등 여러 언어의 번역 작업이 진행되고 있다.

향후 계획 (Cookbook efforts) 커뮤니티가 직접 가치 있는 데이터셋을 구축할 수 있도록 다음과 같은 가이드와 도구를 지원할 예정이다.

  • 도메인 특화 데이터셋: 엔지니어와 도메인 전문가를 연결하여 특정 분야의 데이터셋 구축을 지원한다.
  • DPO/ORPO 및 KTO 데이터셋: 다양한 언어와 작업에 맞춘 DPO 스타일 및 KTO 데이터셋 구축을 돕는 도구를 제공한다.

Hugging Face는 Discord를 통해 데이터셋 빌더 커뮤니티를 확장하며 오픈소스 생태계의 데이터 불균형 해소를 목표로 하고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.