Gemini Robotics-ER 1.6: 향상된 체화 추론
핵심 내용
로봇의 공간 추론·성공 감지·계기판 판독을 강화한 Gemini Robotics-ER 1.6 공개.
자세히 보기
Gemini Robotics-ER 1.6은 로봇이 물리적 환경을 더 정확하게 이해하고, 더 자율적으로 행동하도록 설계된 embodied reasoning 모델이다. 공간 추론, 작업 계획, 성공 감지 같은 고차원 판단을 담당하며, Google Search, VLA 모델, 외부 사용자 정의 함수도 직접 호출할 수 있다.
이전 버전인 1.5와 Gemini 3.0 Flash 대비, 포인팅, 카운팅, 성공 감지 같은 공간·물리 추론 성능이 크게 향상됐다. 개발자는 Gemini API와 Google AI Studio를 통해 사용할 수 있고, Colab 예제도 제공된다.
핵심 기능은 포인팅(Pointing) 이다.
- 객체 탐지와 개수 세기
- 집합 내 최소 항목 찾기 같은 관계 논리
- 궤적 추정과 최적 파지 지점 식별
- "파란 컵에 들어갈 만큼 작은 물체를 가리켜라" 같은 제약 조건 처리
포인팅을 중간 단계로 활용해 복잡한 작업을 단계적으로 푼다. 실험에서는 망치, 가위, 페인트붓, 펜치 등을 정확히 식별했고, 존재하지 않는 손수레나 드릴을 가리키는 환각도 줄었다. 3.0 Flash는 근접한 성능을 보였지만 펜치 인식에서 약점이 있었다.
성공 감지(Success Detection) 도 강화됐다. 여러 카메라 시점을 함께 해석하는 multi-view reasoning으로 가려짐, 조명 변화, 모호한 지시가 있어도 작업 완료 시점을 더 안정적으로 판단한다. 예를 들어 "파란 펜을 검은 펜 홀더에 넣기" 작업이 끝났는지 여러 영상으로 확인할 수 있다.
새로 추가된 Instrument Reading 기능은 실제 산업 현장에서 유용하다. Boston Dynamics Spot이 온도계, 압력계, 시트글라스, 디지털 계기 등을 촬영하면, 모델이 침전액 높이, 눈금, 단위 텍스트, 다중 바늘까지 통합적으로 해석한다. 확대, 포인팅, 코드 실행을 순차적으로 활용해 sub-tick 수준의 정밀 판독도 시도한다.
안전성 측면에서도 개선됐다. Gemini 안전 정책 준수율이 높아졌고, "액체를 다루지 말라", "20kg 이상 물체는 들지 말라" 같은 제약을 포인팅 단계에서 반영한다. 실제 부상 보고서를 바탕으로 한 텍스트·비디오 안전 시나리오 평가에서도 Gemini 3.0 Flash보다 더 높은 점수를 기록했다.
Google DeepMind는 로보틱스 커뮤니티와 협력해 실패 사례를 수집하고, 각 응용 분야에서 10~50장의 라벨링된 이미지를 받아 다음 릴리스의 견고성을 높이려 한다. Gemini Robotics-ER 1.6은 현재 Google AI Studio에서 체험 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.