LeRobot, 비디오 인코딩 기반의 새로운 데이터셋 포맷 공개
Scaling robotics datasets with video encoding
·2024.08.27 09:00
Hugging Face가 로보틱스 데이터셋의 저장 효율과 로딩 속도를 개선하기 위해 비디오 인코딩을 활용한 LeRobotDataset 포맷을 공개했다.
로보틱스 분야는 LLM과 달리 방대한 양의 고품질 데이터를 확보하고 이를 효율적으로 관리하는 데 어려움을 겪고 있다. 기존에는 시각적 데이터를 저장하기 위해 개별 프레임을 PNG 형식으로 저장했으나, 이는 데이터 중복이 심하고 용량이 매우 크다는 단점이 있다.
이를 해결하기 위해 Hugging Face는 LeRobotDataset 포맷을 제안한다. 이 포맷은 현대적인 비디오 코덱을 사용하여 시각적 모달리티를 저장하며, 다음과 같은 성능 향상을 제공한다.
- 데이터 압축: 데이터셋 크기를 기존 대비 평균 14% 수준으로 줄이며, 최적의 경우 **0.2%**까지 압축 가능하다.
- 로딩 속도 개선: 단일 프레임 디코딩 속도는 PNG와 유사하지만, 연속된 여러 프레임을 디코딩할 경우 PNG 대비 25%~50% 더 빠른 속도를 보인다.
이 기술은 이미지 내 유사성을 이용하는 **공간 압축(Spatial Compression)**과 프레임 간 차이점만을 기록하는 시간 압축(Temporal Compression) 원리를 활용한다. 또한, Hugging Face Hub와의 네이티브 통합을 통해 데이터 공유와 시각화가 용이하도록 설계되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.