HuggingFace, 비디오 데이터셋 구축 툴킷 공개
Build awesome datasets for video generation
·2025.02.12 09:00
비디오 생성 모델 학습을 위한 3단계 데이터셋 구축 파이프라인과 오픈소스 툴킷을 소개한다.
비디오 생성 모델의 성능은 학습 데이터의 품질에 직결된다. HuggingFace는 이미지 데이터셋 구축 도구인 img2dataset처럼, 비디오 데이터셋을 효율적으로 구축할 수 있는 3단계 파이프라인과 오픈소스 툴킷을 공개했다.
1단계: 데이터 수집 (Acquisition)
yt-dlp를 사용하여 영상을 다운로드한다.Video to Scenes스크립트를 통해 긴 영상을 짧은 클립으로 분할한다.
2단계: 전처리 및 필터링 (Pre-processing/filtering)
- 프레임 단위: 워터마크 감지(LAION-5B), 미적 점수(Aesthetic score) 예측, NSFW 콘텐츠 감지를 수행한다.
- 영상 단위: OpenCV를 활용하여 영상의 움직임(Motion score)을 측정한다.
3단계: 데이터 처리 (Processing)
- Florence-2를 사용하여 프레임별 캡셔닝, 객체 인식, OCR 작업을 수행한다.
- 또는 Qwen2.5-VL과 같은 모델을 사용하여 영상 전체에 대한 캡셔닝을 진행할 수 있다.
실제 사례로 crush-smol-v0 데이터셋 구축 시, 워터마크 확률 0.1 미만, 미적 점수 5.5 이상의 엄격한 필터링을 적용하여 고품질의 영상만을 선별하는 과정을 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.