AI Briefing

Apple, REFACTOR-VLA 공개… 무감독 학습으로 재사용 가능한 로봇 동작 스킬 개발

·2026.09.02 09:00

핵심 내용

Apple이 무감독 학습으로 재사용 가능한 로봇 동작 스킬을 개발하는 REFACTOR-VLA 시스템을 공개했다.

자세히 보기

Apple 연구진이 기존 모놀리식 VLA 모델의 한계를 극복하기 위해 REFACTOR-VLA 시스템을 공개했다. 이 시스템은 'wake/sleep' 아키텍처를 통해 재사용 가능한 스킬을 학습하며, 긴 시간 범위의 다단계 작업 수행 능력을 향상시킨다.

핵심 기술 및 작동 원리

REFACTOR-VLA는 두 가지 주요 단계로 구성된다. Sleep phase에서는 학습된 잠재 세계 모델(Mφ)을 기반으로 행동 등가성 커널(BEK)을 사용하여 모터 프로그램 세그먼트를 클러스터링한다. Wake phase에서는 Hindley-Milner 타입 시스템에서 영감을 받은 어휘를 사용해 타입이 지정된 lambda term을 생성하고, 이를 라이브러리 조건부 rectified-flow 액션 디코더에 입력하여 실제 동작을 산출한다.

스킬로 인정받기 위해서는 최소 설명 길이(MDL) 기준과 보상 보존 게이트를 모두 통과해야 한다. 학습은 세계 모델 워밍업, 정책 최적화, 스킬 발견의 3단계 스케줄로 진행된다.

LIBERO 벤치마크 결과 및 시사점

LIBERO 벤치마크 스위트 전체를 대상으로 한 평가에서 두 가지 중요한 발견이 있었다. 첫째, 세계 모델의 크기를 1억 8,800만 파라미터에서 4억 3,000만 파라미터로 늘리면 성능이 오히려 저하되는 현상이 4개 스위트 중 4개에서 발생했다. 이는 세계 모델을 단순히 크게 만드는 것이 항상 성능 향상을 가져오지 않음을 입증한다.

둘째, 학습 목표의 변경이 스킬 클러스터링 품질에 큰 영향을 미쳤다. Phase A에서 보조 지도 대조 손실(InfoNCE loss)을 추가하면 Phase C의 스킬 클러스터링 품질이 크게 개선되었다. n=3 멀티 시딩 기준 정규화 상호 정보(NMI)는 Object suite 0.462, Spatial suite 0.867, Goal suite 0.915, LIBERO-10 suite 0.754로 측정되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.