AI Briefing

HuggingFace, 고품질 비디오 데이터셋 FineVideo 공개

FineVideo: behind the scenes

·2024.09.23 09:00

핵심 내용

HuggingFace가 풍부한 메타데이터를 포함한 43,000개의 비디오 데이터셋 FineVideo를 공개했다.

자세히 보기

오픈 소스 비디오 AI 개발의 병목 현상인 데이터 부족 문제를 해결하기 위해 HuggingFace가 FineVideo 데이터셋을 출시했다. 이 데이터셋은 총 **43,000개의 비디오(약 3,400시간 분량)**로 구성되어 있으며, 단순 영상뿐만 아니라 상세한 설명, 내러티브 디테일, 장면 분할(scene splits), 질의응답(QA) 쌍 등 풍부한 주석을 포함하고 있다.

데이터셋 구축 과정은 다음과 같은 정교한 파이프라인을 거쳤다:

  • 데이터 필터링: YouTube-Commons의 190만 개 영상 중 영어 기반 영상을 추출한 뒤, 단어 밀도(word density)와 시각적 역동성(visual dynamism)을 기준으로 동적 콘텐츠를 선별했다.
  • 자동화된 주석 생성: 긴 영상의 콘텐츠 선택에는 Gemini 1.5 Pro를 활용했으며, 구조화된 데이터 출력을 위해 GPT-4o를 사용하여 정밀한 메타데이터를 생성했다.
  • 카테고리화: 자체 구축한 분류 체계(Taxonomy)를 적용하여 영상의 내용을 체계적으로 분류했다.

FineVideo는 비디오 이해(Video Understanding), 텍스트 기반 비디오 생성(Diffusion Models), 컴퓨터 비전 모델 학습을 위한 핵심 재료로 활용될 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.