Nvidia, 고속 Vision 모델 공개
Nvidia LocateAnything - Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding. (10x faster than Qwen3-VL)
·2026.05.28 15:43
Nvidia가 병렬 박스 디코딩을 통해 Qwen3-VL보다 10배 빠른 Vision-Language Grounding 모델 'LocateAnything'을 공개했다.
Nvidia가 병렬 박스 디코딩(Parallel Box Decoding) 기술을 활용하여 고품질의 시각-언어 접지(Vision-Language Grounding)를 수행하는 LocateAnything-3B 모델을 공개했다.
이 모델은 기존 Qwen3-VL 대비 약 10배 빠른 속도를 구현하면서도 높은 정확도를 유지하는 것이 특징이다. 사용자는 Hugging Face를 통해 모델을 이용하거나 GitHub의 Eagle 리포지토리를 통해 관련 코드를 확인할 수 있다.
주요 특징:
- 병렬 박스 디코딩: 추론 속도의 획기적 개선
- 고성능 Grounding: 이미지 내 객체 위치의 정밀한 식별
- 오픈 소스 제공: 모델 가중치 및 소스 코드 공개
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.