AI Briefing

HuggingFace, 데이터 스트리밍 100배 개선

Streaming datasets: 100x More Efficient

·2025.10.27 09:00

HuggingFace가 `datasets` 라이브러리의 스트리밍 효율을 개선해 대규모 데이터 학습 속도를 높였다.

HuggingFace가 datasets 라이브러리의 스트리밍(streaming=True) 기능을 대폭 개선하여, 테라바이트(TB)급 대규모 데이터셋을 다운로드 없이도 훨씬 빠르고 안정적으로 학습할 수 있게 했다.

주요 개선 사항은 다음과 같다:

1. 시작 단계(Startup) 최적화

  • 데이터 파일 캐싱: 모든 DataLoader 워커가 개별적으로 요청을 보내던 기존 방식 대신, 첫 번째 워커가 파일 목록을 가져오면 나머지 워커는 이를 로컬 캐시에서 읽도록 하여 요청 폭주(request storm) 문제를 해결했다.
  • 해상도 로직 최적화: API 호출 횟수를 최소화하여 데이터 파일 목록을 확인하는 시간을 10배 단축했다.

2. 스트리밍(Streaming) 성능 향상

  • Parquet 프리페칭(Prefetching): 모델이 현재 데이터를 처리하는 동안 다음 데이터 청크를 백그라운드에서 미리 가져와 GPU 대기 시간을 최소화한다.
  • 설정 가능한 버퍼링: 사용자가 하드웨어 및 네트워크 환경에 맞춰 버퍼 블록 크기와 프리페치 양을 직접 조절할 수 있는 옵션을 제공한다.

이번 업데이트를 통해 시작 요청 횟수는 최대 100배 감소했으며, 데이터 해상도 속도는 10배, 스트리밍 속도는 최대 2배 빨라졌다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.