Nvidia, 고속 Grounding 모델 공개
Nvidia LocateAnything - Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding. (10x faster than Qwen3-VL)
·2026.05.28 15:43
Nvidia가 병렬 박스 디코딩을 통해 Qwen3-VL보다 10배 빠른 Vision-Language Grounding 모델 LocateAnything을 공개했다.
Nvidia가 이미지 내 객체의 위치를 정밀하게 식별하는 Vision-Language Grounding 모델인 LocateAnything-3B를 공개했다.
이 모델은 Parallel Box Decoding 기술을 도입하여, 기존 모델인 Qwen3-VL보다 최대 10배 빠른 추론 속도를 구현하면서도 높은 품질의 결과를 제공한다.
주요 특징은 다음과 같다:
- 고속 추론: 병렬 디코딩 방식을 통해 객체 위치 파악 속도를 획기적으로 개선했다.
- 고품질 Grounding: 시각적 언어 이해를 바탕으로 객체의 좌표를 정확하게 추출한다.
- 접근성: Hugging Face를 통해 모델이 공개되었으며, GitHub와 Spaces를 통해 데모를 즉시 체험할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.