AI Briefing

Rhoda AI, 웹 비디오 사전학습 스케일링이 실제 로봇 작업 성능 향상 입증

·2026.09.11 09:00

핵심 내용

Rhoda AI가 웹 비디오 사전학습 모델 규모와 컴퓨팅 자원 확대가 실제 산업용 로봇 작업의 완료율을 높인다는 사실을 실험으로 입증했다.

자세히 보기

Rhoda AI는 DVA 모델을 활용해 웹 비디오 사전학습(web-video pre-training)의 스케일링이 실제 로봇 성능으로 이어지는지 검증했다. 실험 결과, 사전학습 모델의 파라미터 수와 컴퓨팅 자원을 늘릴수록 로봇 정책의 성능이 일관되게 개선되었으며, 이는 최대 테스트 크기까지 유지되는 추세였다.

실험 설계와 평가 지표

실험은 웹 비디오로 사전학습한 후 로봇 데이터로 사후학습(post-train)하는 방식을 따랐다. 품질 지표로는 DINO FD(held-out 웹 비디오 예측 프레임과 실제 프레임의 DINOv2 feature 분포 거리)를 사용했으며, 값이 낮을수록 예측 성능이 좋음을 의미한다. 실제 작업 평가에는 베어링 언팩킹 및 포장재 분류 등 14단계의 산업용 조작 작업이 포함되었으며, 총 200시간 이상의 평가 시간이 소요되었다. 평가 지표로는 단순 완료율보다 정밀한 At-speed completion rate(평균 사이클 타임 기준 완료율)를 적용했다.

모델 크기 및 컴퓨팅 자원 효과

모델 크기를 XS에서 L로 확대할 때 At-speed completion rate는 4%에서 85%로 단조롭게 증가했다. 특히 모델 크기 확대는 정확도 향상보다는 완료 시간 단축에 기여하여 첫 시도 성공률을 높이고 재시도를 줄였다. M-size 모델 고정 상태에서 사전학습 컴퓨팅 자원을 0.08x에서 1x로 늘렸을 때는 67%에서 75%로 개선되었으나, 0.37x 이후로는 성능 향상이 정체(plateau)되었다.

데이터 부족 시 사전학습의 가치

사전학습 컴퓨팅 자원의 효과는 사후학습 데이터가 부족할 때 두드러졌다. 전체 데이터(100%) 사용 시에는 컴퓨팅 자원 수준 간 차이가 미미했지만, 데이터 양을 25%로 줄이자 1x와 0.18x 컴퓨팅 자원 모델 간에 8%p의 성능 차이가 발생했다. 이는 로봇 데모 데이터가 부족할 때 대규모 웹 비디오 사전학습이 가장 큰 이점을 제공함을 시사한다.

DINO FD와 로봇 성능의 상관관계

DINO FD는 모델 크기나 컴퓨팅 자원 증가 방식과 무관하게 로봇 태스크 성능을 예측하는 유효한 지표로 확인되었다. 유사한 DINO FD 점수를 가진 모델들은 통계적으로 유의미한 성능 차이를 보이지 않았다. 다만, DINO FD와 실제 성능은 상관관계일 뿐 인과성은 검증되지 않았으며, 단일 아키텍처와 단일 태스크 기반의 한계가 존재한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.