AI Briefing

Hugging Face, The Stack v3 공개

Hugging Face releases The Stack v3 – largest open code dataset yet

·2026.07.24 20:57

핵심 내용

Hugging Face가 역대 최대 규모의 오픈 소스 코드 데이터셋인 The Stack v3를 출시했다.

자세히 보기

Hugging Face가 역대 가장 큰 규모의 오픈 코드 데이터셋인 The Stack v3를 공개했다. 이번 릴리스는 사용자의 목적에 따라 두 가지 방식으로 제공된다.

  • stack-v3-train: 중복 제거(near-deduplicated), 품질 필터링, 개인정보(PII) 삭제가 완료된 데이터셋으로, 즉시 학습에 사용할 수 있도록 구성되었다.
  • stack-v3-full: 전체 114TB 규모의 코퍼스를 HF Storage Bucket 형태로 제공하며, 클러스터 ID가 포함된 모든 중복 데이터를 유지하여 사용자가 직접 필터링 및 혼합(mix)을 수행할 수 있도록 한다.

개발자들은 데이터셋을 직접 로드하여 코드 모델 학습 및 연구에 활용할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.