Hugging Face, Parquet 중복 제거 최적화
Improving Parquet Dedupe on Hugging Face Hub
·2024.10.05 09:00
Hugging Face가 대규모 데이터셋 효율성을 위해 Parquet 파일의 중복 제거 문제를 분석하고 개선 방안을 제시했다.
Hugging Face는 현재 약 11PB의 데이터셋을 호스팅하고 있으며, 이 중 2.2PB가 Parquet 파일로 구성되어 있어 저장 공간 최적화가 매우 중요한 과제다.
기존의 Byte-level Content-Defined Chunking (CDC) 방식은 데이터 추가(Append) 시에는 99.1%의 높은 중복 제거율을 보이지만, 데이터 수정(Modification)이나 삭제(Deletion) 시에는 효율이 급격히 떨어진다.
- 수정(Modification): Parquet 컬럼 헤더에 절대 파일 오프셋이 포함되어 있어, 작은 수정만으로도 헤더가 재작성되어 중복 제거율이 89%로 하락한다.
- 삭제(Deletion): 행 그룹(Row Group) 구조가 재편성되고 압축 방식 때문에 데이터 블록이 완전히 새로 생성되는 문제가 발생한다.
Hugging Face 팀은 이를 해결하기 위해 고정된 행 개수가 아닌, 특정 키(Key) 컬럼의 해시값을 기반으로 행 그룹을 나누는 Content Defined Row Groups 방식을 해결책으로 검토하고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.