AI Briefing

GUI 에이전트 평가 도구 ScreenSuite 출시

ScreenSuite - The most comprehensive evaluation suite for GUI Agents!

·2025.06.06 09:00

핵심 내용

GUI 에이전트의 성능을 다각도로 평가할 수 있는 통합 벤치마크 스위트 ScreenSuite가 출시되었다.

자세히 보기

HuggingFace가 **Vision Language Models(VLMs)**의 에이전트 능력을 다각도로 평가할 수 있는 통합 벤치마크 스위트인 ScreenSuite를 공개했다.

ScreenSuite는 GUI 에이전트의 핵심 역량을 다음 네 가지 범주로 분류하여 평가한다:

  • Perception (인지): 화면에 표시된 정보를 정확하게 파악하는 능력
  • Grounding (그라운딩): 요소의 위치를 이해하여 정확한 지점을 클릭하는 능력
  • Single-step actions (단일 단계 동작): 한 번의 동작으로 지시를 수행하는 능력
  • Multi-step agents (다단계 에이전트): 여러 단계를 거쳐 고차원적인 목표를 달성하는 능력

이 스위트는 모바일, 데스크톱, 웹 환경을 아우르는 13개의 벤치마크를 통합하여 제공한다. 특히 다단계 에이전트 평가의 기술적 난제를 해결하기 위해 E2B 데스크톱 원격 샌드박스를 지원하며, Docker를 통해 Ubuntu나 Android 가상 머신을 쉽게 실행할 수 있는 새로운 옵션을 도입했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.