로보틱스용 Zero-Shot 비전 라이브러리 공개
Pollen-Vision: Unified interface for Zero-Shot vision models in robotics
·2024.03.25 09:00
로봇의 객체 파악 및 조작을 지원하기 위해 Zero-Shot 비전 모델을 통합한 오픈소스 라이브러리 Pollen-Vision이 공개되었다.
Pollen Robotics 팀이 개발한 pollen-vision은 로봇이 미지의 객체를 인식하고 조작할 수 있도록 돕는 오픈소스 라이브러리다.
이 라이브러리는 별도의 추가 학습 없이 즉시 사용 가능한 Zero-Shot 모델들을 결합하여, 객체의 3D 공간 좌표(x, y, z)를 추정하는 3D 객체 탐지 파이프라인을 구축하는 데 중점을 둔다.
핵심적으로 포함된 모델은 다음과 같다:
- OWL-VIT: 텍스트 기반의 2D 객체 위치 탐지 및 바운딩 박스 생성
- Mobile SAM: 경량화된 세그멘테이션 모델을 통한 객체 마스크 생성
- RAM (Recognize Anything Model): 이미지 내 객체 태깅 및 인식
사용자는 텍스트 프롬프트와 이미지만을 입력하여 객체 탐지 및 세그멘테이션 과정을 간단히 구현할 수 있으며, 소비자용 GPU에서 실시간(few fps)으로 동작할 수 있도록 설계되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.