AI Briefing

Tencent, 멀티모달 기반 로봇 인지 모델 RxBrain 공개

tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face

·2026.07.15 18:30

Tencent가 언어 추론과 시각적 상상을 결합하여 로봇의 행동 계획을 수립하는 RxBrain 모델을 공개했다.

Tencent가 Embodied Cognition(체화된 인지)을 위한 통합 멀티모달 파운데이션 모델인 RxBrain-1.0을 Hugging Face에 공개했습니다. 이 모델은 언어 추론과 시각적 상상을 결합하여 로봇이 물리적 세계를 이해하고 행동을 계획할 수 있도록 설계되었습니다.

핵심 기능:

  • Embodied Understanding & Reasoning: 이미지 및 멀티 프레임 비디오에 대한 질의응답 및 Chain-of-Thought(사고의 사슬) 수행
  • World State Prediction: 특정 행동을 취했을 때 물리적 세계에서 나타날 미래 프레임을 시각적으로 예측
  • Joint Subgoal Planning: 작업을 단계별 하위 목표로 분해하고, 각 단계에 필요한 언어적 행동 지침도달해야 할 목표 이미지를 동시에 생성

기술적 특징:

  • Unified Mixture-of-Transformers (MoT): 약 6.2B 파라미터 규모의 백본을 사용하며, 텍스트, 비전, 생성 모달리티를 하나의 오토레그레시브(Autoregressive) 모델 내에서 통합 처리합니다.
  • Flow-Matching Image Head: FLUX VAE 잠재 공간을 디코딩하는 Flow-matching 헤드를 통해 텍스트-이미지 생성 및 멀티 프레임 월드 모델 롤아웃을 구현합니다.
  • Interleaved Reasoning + Imagination: 텍스트 추론과 생성된 프레임을 하나의 시퀀스로 교차 생성하여, 상징적 계획과 시각적 목표를 결합합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.