Nvidia, 고속 Grounding 모델 공개
Nvidia LocateAnything - Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding. (10x faster than Qwen3-VL)
·2026.05.28 15:43
핵심 내용
Nvidia가 병렬 박스 디코딩을 통해 Qwen3-VL보다 10배 빠른 Vision-Language Grounding 모델 LocateAnything을 공개했다.
자세히 보기
Nvidia가 이미지 내 객체의 위치를 정밀하게 식별하는 Vision-Language Grounding 모델인 LocateAnything-3B를 공개했다.
이 모델은 Parallel Box Decoding 기술을 도입하여, 기존 모델인 Qwen3-VL보다 최대 10배 빠른 추론 속도를 구현하면서도 높은 품질의 결과를 제공한다.
주요 특징은 다음과 같다:
- 고속 추론: 병렬 디코딩 방식을 통해 객체 위치 파악 속도를 획기적으로 개선했다.
- 고품질 Grounding: 시각적 언어 이해를 바탕으로 객체의 좌표를 정확하게 추출한다.
- 접근성: Hugging Face를 통해 모델이 공개되었으며, GitHub와 Spaces를 통해 데모를 즉시 체험할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.