AI Briefing

로보틱스용 Zero-Shot 비전 라이브러리 공개

Pollen-Vision: Unified interface for Zero-Shot vision models in robotics

·2024.03.25 09:00

핵심 내용

로봇의 객체 파악 및 조작을 지원하기 위해 Zero-Shot 비전 모델을 통합한 오픈소스 라이브러리 Pollen-Vision이 공개되었다.

자세히 보기

Pollen Robotics 팀이 개발한 pollen-vision은 로봇이 미지의 객체를 인식하고 조작할 수 있도록 돕는 오픈소스 라이브러리다.

이 라이브러리는 별도의 추가 학습 없이 즉시 사용 가능한 Zero-Shot 모델들을 결합하여, 객체의 3D 공간 좌표(x, y, z)를 추정하는 3D 객체 탐지 파이프라인을 구축하는 데 중점을 둔다.

핵심적으로 포함된 모델은 다음과 같다:

  • OWL-VIT: 텍스트 기반의 2D 객체 위치 탐지 및 바운딩 박스 생성
  • Mobile SAM: 경량화된 세그멘테이션 모델을 통한 객체 마스크 생성
  • RAM (Recognize Anything Model): 이미지 내 객체 태깅 및 인식

사용자는 텍스트 프롬프트와 이미지만을 입력하여 객체 탐지 및 세그멘테이션 과정을 간단히 구현할 수 있으며, 소비자용 GPU에서 실시간(few fps)으로 동작할 수 있도록 설계되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.