Stanford, 로봇 범용 포스트 트레이닝 알고리즘 EXPO-FT 제안
·2026.09.24 09:00
핵심 내용
Stanford 연구진이 로봇 범용 포스트 트레이닝 알고리즘 EXPO-FT를 제안해 물리적 작업에서 100% 성공률을 달성했다.
자세히 보기
Stanford, 로봇 범용 포스트 트레이닝 알고리즘 EXPO-FT 제안
Perry Dong, Chelsea Finn 등 Stanford 연구진은 로봇 분야가 초기 언어 모델 단계와 유사하다고 진단하며, 사전 학습은 성공했으나 표준화된 포스트 트레이닝 레시피 부재로 신뢰할 수 있는 배포가 실패하고 있다고 지적했다. 이에 따라 대규모 사전 학습된 정책의 강화 학습 불안정성을 경량 편집 정책(lightweight editing policy)으로 격리하는 알고리즘 EXPO-FT를 제안했다.
- 작동 원리: 기존 강화 학습처럼 대형 모델 가중치를 직접 수정하지 않고, 편집 정책을 통해 프론티어 모델의 출력을 가치 함수로 평가된 고가치 상태로 유도한다. 이후 성공적인 행동을 기본 모델로 증류(distillation)하여 안정성을 유지하며 새로운 행동을 학습시킨다.
- 실험 결과: 크리스마스 조명 정리, 당구 공 넣기, 꽃병에 꽃 꽂기 등 물리적 작업에서 EXPO-FT는 30/30 성공률(100%)을 기록하며 SFT, HIL-SERL 등 베이스라인을 크게 능가했다.
- 한계 및 과제: 현재는 성공 정의, 환경 리셋, 피드백 제공에 인간 개입이 필요하다. 저자들은 보상 명세, 리셋 메커니즘, 하이퍼파라미터 튜닝을 위한 표준화된 관행이 부재함을 지적하며, 이를 해결해야 확장 가능하다고 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.