VLX-Seek 1.5 10B 공개
omlab/VLX-Seek-1.5-10B · Hugging Face
·2026.08.10 13:32
핵심 내용
VLX-Seek 1.5 10B가 실세계 시각 그라운딩용 오픈소스 모델로 공개됐다.
자세히 보기
VLX-Seek 1.5-10B는 드론, 로봇, 감시 카메라, 검사 시스템 등 엣지 환경을 겨냥한 10B 규모 오픈소스 비전언어모델이다.
좌표 숫자를 직접 생성하는 대신 후보 영역을 언어로 참조 가능한 엔티티로 변환하고, 모델이 영역을 선택·비교·지칭하는 region retrieval·reference 방식으로 시각적 위치 지정을 수행한다.
주요 특징은 다음과 같다.
- 드론·감시·로봇 시점의 실세계 장면에 최적화된 embodied visual grounding
- 강력한 보조 비전 타워와 개선된 vision-language 정렬
- OPN 제안 생성과 Linear Attention을 통한 추론 속도·메모리 효율 개선
- hard-negative rejection 학습과 None 출력을 통한 부재 객체 오탐지 억제
- 0.6B, 3B, 10B로 구성되는 멀티스케일 모델군
기술 세부사항과 실행 코드는 om-ai-lab/VLX-Seek GitHub 저장소에서 제공된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.