AI Briefing

Gemini Robotics-ER 1.6: 강화된 embodied reasoning으로 실제 로봇 작업을 구동하기

·2026.04.15 09:00

핵심 내용

Gemini Robotics-ER 1.6가 공간 추론·instrument reading·안전성을 강화했다.

1 / 2

자세히 보기

Google DeepMind가 Gemini Robotics-ER 1.6를 공개했다. 이 모델은 로봇이 단순히 지시를 따르는 수준을 넘어, 물리 세계를 이해하고 추론하도록 설계된 reasoning-first 모델이다.

핵심 개선점은 spatial reasoning, multi-view understanding, task planning, success detection다. 고수준 추론 모델로서 Google Search, VLA(Vision-Language-Action) 모델, 또는 사용자가 정의한 외부 함수까지 호출해 작업을 진행할 수 있다.

벤치마크에서는 Gemini Robotics-ER 1.5와 Gemini 3.0 Flash보다 전반적으로 더 나은 성능을 보였다. 특히:

  • pointing: 여러 객체를 더 정확하게 지목하고, 없는 물체는 지목하지 않음
  • counting: 수량 판단과 객체 구분이 개선됨
  • success detection: 여러 카메라 시점을 함께 해석해 작업 완료 여부를 더 잘 판단함

새로운 능력으로 instrument reading을 강조한다. 압력 게이지, sight glass, 디지털 계기판 같은 산업 현장의 장비를 읽는 기능으로, Boston Dynamics와의 협업에서 나온 실제 사용 사례를 반영했다.

이 기능은 단순한 시각 인식이 아니라,

  • 이미지를 확대해 세부를 확인하고
  • pointing과 code execution으로 눈금과 비율을 추정하며
  • 세계 지식을 적용해 최종 값을 해석하는 과정으로 동작한다.

안전성도 강화됐다. 모델은 Gemini safety policies 준수에서 이전 세대보다 나아졌고, 물리적 제약이 있는 상황에서 더 안전한 선택을 하도록 학습됐다. 또한 실생활 injury report를 바탕으로 한 text/video safety 평가에서도 baseline인 Gemini 3.0 Flash보다 높은 성능을 보였다.

현재 Gemini API와 Google AI Studio에서 개발자에게 제공되며, 시작용 Colab 예제도 함께 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.