AI Briefing

Cosmos 3가 물리적 AI의 사전 판단을 돕는 방법

·2026.06.01 13:45

NVIDIA가 물리적 AI의 인지, 예측, 행동을 지원하는 세계 모델 파운데이션 모델 **Cosmos 3**를 공개했다.

로봇, 자율주행차(AV), 스마트 공간과 같은 물리적 AI 시스템이 자율적으로 작동하려면 단순히 현재를 보는 것을 넘어 다음에 일어날 일을 예측해야 한다. 하지만 현실 세계의 복잡한 시나리오를 직접 재현하고 학습시키는 것은 비용과 시간 측면에서 매우 어렵다.

NVIDIA Cosmos 3는 이러한 문제를 해결하기 위해 설계된 새로운 **세계 모델(World Foundation Model)**이다. 이 모델은 텍스트, 비디오, 이미지, 주변 소리, 그리고 행동(action)을 아우르는 멀티모달 생성을 결합하여 개발자가 물리적 맥락이 담긴 세계 데이터를 생성할 수 있도록 돕는다.

mixture-of-transformers 아키텍처를 기반으로 하는 Cosmos 3는 다음과 같은 방식으로 작동한다:

  • Reasoning block: 장면에서 현재 어떤 일이 일어나고 있는지 해석한다.
  • Generation block: 해석된 맥락을 바탕으로 합성 비디오나 로봇 작업 데이터와 같은 물리적으로 근거 있는 결과물을 생성한다.

특히 Cosmos 3는 관절 각도, 그리퍼 위치, 궤적 지점 등 로봇의 움직임을 설명하는 수치 데이터를 직접 생성할 수 있는 omnimodel이다. 이를 통해 개발자는 특정 로봇의 형태나 작업 환경에 맞춰 모델을 미세 조정(fine-tuning)할 수 있다.

현재 NVIDIA GEAR 팀은 이를 통해 비디오 액션 모델을 개발 중이며, Agile Robots는 휴머노이드 로봇의 정책 개발을 위해 Cosmos 3를 활용해 다양한 작업 궤적 데이터를 생성하고 있다. Cosmos 3 Nano는 시뮬레이션 기반의 RoboLab과 실제 환경의 RoboArena 벤치마크에서 선두를 기록하며 뛰어난 성능을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.