AI Briefing

LingBot-Video 오픈소스 공개

LingBot-Video: sparse-MoE video diffusion transformer (13B total, 1.4B active) post-trained as an action-conditioned world model[R]

·2026.07.09 02:58

Sparse-MoE 구조를 활용하여 로봇 동작을 예측하는 액션 조건부 월드 모델 LingBot-Video가 공개되었습니다.

LingBot-Video는 DeepSeek-V3 스타일의 Sparse MoE 구조를 채택한 단일 스트림 확산 트랜스포머(Diffusion Transformer) 모델입니다. 전체 파라미터는 13B이며, 추론 시에는 1.4B의 활성 파라미터만 사용합니다.

주요 특징은 다음과 같습니다:

  • RL 사후 학습: 물리적 타당성(Physical-plausibility) 보상을 포함한 6가지 보상 체계를 적용한 강화학습을 수행했습니다.
  • 액션-비디오 모드: 로봇의 동작(Action)과 손 포즈(Hand-pose) 조건을 바탕으로 로봇의 움직임을 비디오 형태로 예측합니다.
  • 성능: RBench에서 평균 최고 성능을 기록했으며, 비디오 생성 품질 측면에서도 뛰어난 성능을 보여줍니다.

현재 모델 가중치, 코드 및 Diffusers/SGLang 스택이 오픈소스로 공개되어 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.