AI Briefing

GUI Grounding 모델 Vista 9B/4B 공개

Vista 9B/4B from inclusionAI

·2026.06.13 16:50

Qwen 3.5를 기반으로 GUI 요소의 좌표를 정밀하게 예측하는 Vista 모델이 공개되었습니다.

inclusionAI가 Qwen 3.5 9B를 백본으로 사용하는 GUI Grounding 시각-언어 모델인 VISTA-9BVISTA-4B를 공개했습니다. 이 모델은 스크린샷과 자연어 지시어를 입력받아 이미지 프레임 내의 클릭 좌표를 0-1000 사이의 정규화된 값으로 출력합니다.

주요 기술적 특징은 다음과 같습니다:

  • View-Consistent GRPO Training: 동일한 GUI 인스턴스에 대해 서로 다른 뷰(View)를 생성하여 학습함으로써, 기하학적 변화가 있는 스크린샷에서도 일관된 위치를 찾아내는 능력을 강화했습니다.
  • Self-verified Cross-view Anchoring: 모델이 생성한 결과가 최대 보상을 얻었을 때만 오라클(Oracle) 형식의 중심점 앵커를 추가하는 학습 방식을 사용하여, 좌표 생성의 안정성을 높였습니다.

해당 모델은 Hugging Face를 통해 오픈 소스로 제공됩니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.