AI Briefing

Dyna-2: World-Action Model의 100만 시간 스케일링 법칙

·2026.08.11 09:00

핵심 내용

Dyna-2가 100만 시간의 인간 영상으로 인간·로봇 모두의 스케일링 법칙을 입증했다.

자세히 보기

Dyna-2는 100만 시간 이상의 1인칭 인간 영상으로 사전 학습한 **World-Action Model(WAM)**이다. 이는 사람이 수행하는 작업을 관찰해 장면 변화, 물체의 접촉 반응, 손과 물체의 상호작용을 학습하는 접근법을 취한다. 100만 시간은 약 170년에 해당하는 연속적인 인간 활동 데이터다.

Dyna-2는 1,000시간부터 100만 시간까지 인간 영상 학습량을 늘린 실험에서 보류된 인간 데이터의 성능이 일관되게 향상되는 스케일링 추세를 보였다. 인간 데이터에 대한 학습량 증가가 모델 성능 개선으로 이어지는 기존 스케일링 법칙을 확인한 셈이다.

특히 사전 학습에 로봇 데이터를 전혀 사용하지 않았음에도 로봇 데이터에서 성능 향상이 나타났다. 인간 영상 학습량이 증가할수록 로봇 행동 예측의 MSE가 낮아지고 정확도@0.5가 높아져, 인간-로봇 전이 스케일링 법칙의 존재를 처음 입증했다고 설명한다.

Dyna Robotics는 로봇 학습용 사전 학습 데이터로 원격조작이나 특수 캡처 장비로 만든 데이터보다, 인간이 실제 경제 활동을 수행하는 모습을 담은 센서화 영상이 더 적합하다고 주장한다. 이러한 데이터는 사실상 무제한으로 확보할 수 있으며, 범용 로봇이 수행해야 할 작업과 직접 연결된다는 이유에서다.

다만 인간과 로봇 사이에는 형태와 구현 방식의 차이라는 embodiment gap이 남아 있다. 연구진은 인간-로봇 전이 스케일링 법칙이 확인된 만큼, 앞으로는 인간 영상 데이터를 계속 확대하는 동시에 로봇의 형태와 능력을 인간에 가깝게 발전시키는 방향이 유효하다고 제안한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.