AI Briefing

Nvidia, 고속 Vision 모델 공개

Nvidia LocateAnything - Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding. (10x faster than Qwen3-VL)

·2026.05.28 15:43

핵심 내용

Nvidia가 병렬 박스 디코딩을 통해 Qwen3-VL보다 10배 빠른 Vision-Language Grounding 모델 'LocateAnything'을 공개했다.

자세히 보기

Nvidia가 병렬 박스 디코딩(Parallel Box Decoding) 기술을 활용하여 고품질의 시각-언어 접지(Vision-Language Grounding)를 수행하는 LocateAnything-3B 모델을 공개했다.

이 모델은 기존 Qwen3-VL 대비 약 10배 빠른 속도를 구현하면서도 높은 정확도를 유지하는 것이 특징이다. 사용자는 Hugging Face를 통해 모델을 이용하거나 GitHub의 Eagle 리포지토리를 통해 관련 코드를 확인할 수 있다.

주요 특징:

  • 병렬 박스 디코딩: 추론 속도의 획기적 개선
  • 고성능 Grounding: 이미지 내 객체 위치의 정밀한 식별
  • 오픈 소스 제공: 모델 가중치 및 소스 코드 공개

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.