Hugging Face, The Stack v3 공개
Hugging Face releases The Stack v3 – largest open code dataset yet
·2026.07.24 20:57
Hugging Face가 역대 최대 규모의 오픈 소스 코드 데이터셋인 The Stack v3를 출시했다.
Hugging Face가 역대 가장 큰 규모의 오픈 코드 데이터셋인 The Stack v3를 공개했다. 이번 릴리스는 사용자의 목적에 따라 두 가지 방식으로 제공된다.
- stack-v3-train: 중복 제거(near-deduplicated), 품질 필터링, 개인정보(PII) 삭제가 완료된 데이터셋으로, 즉시 학습에 사용할 수 있도록 구성되었다.
- stack-v3-full: 전체 114TB 규모의 코퍼스를 HF Storage Bucket 형태로 제공하며, 클러스터 ID가 포함된 모든 중복 데이터를 유지하여 사용자가 직접 필터링 및 혼합(mix)을 수행할 수 있도록 한다.
개발자들은 데이터셋을 직접 로드하여 코드 모델 학습 및 연구에 활용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.