AI Briefing

모바일 에이전트 벤치마크 공개

Lit Review on Benchmarking LLMs Running in your phone!: MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments

·2026.09.07 15:39

핵심 내용

사용자 상호작용 및 MCP 도구 활용 능력을 평가하는 모바일 에이전트 벤치마크 'MobileWorld'가 공개됐다.

자세히 보기

모바일 기기에서 자율적으로 GUI 작업을 수행하는 LLM 에이전트의 성능을 평가하기 위한 새로운 벤치마크 **'MobileWorld'**가 공개됐다. 이 벤치마크는 기존 평가 방식의 한계를 보완하기 위해 **사용자 상호작용(User Interaction)**과 MCP(Model Context Protocol) 도구 활용이라는 두 가지 새로운 평가 축을 도입했다.

벤치마크 구성 및 특징

  • 평가 범위: 통신, 메시징, 생산성 등 일상적으로 사용하는 20개 이상의 앱을 대상으로 총 201개의 태스크를 포함한다. 시스템 앱 비중은 5% 미만으로 실제 사용자 환경에 가깝게 구성했으나, 일부 앱은 오픈소스 대체 버전을 사용하여 제한점이 있다.
  • 아키텍처: 스크린샷만 입력받는 VLM(비전 언어 모델) 기반의 Planner와 자연어 지시를 좌표(x,y)로 변환하는 Grounding Model로 구성된 Planner-Executor 구조를 사용한다.
  • 새로운 평가 축:
    • 사용자 상호작용 태스크: 정보가 부족한 상황에서 에이전트가 사용자에게 질문하고 답변을 받아 작업을 완수하는 능력을 평가한다. 여기서 '사용자'는 GPT-4 모델이 대체한다.
    • MCP 태스크: GitHub, arXiv 등 외부 데이터 수집 및 복잡한 작업이 가능한 MCP 도구를 활용해 GUI 클릭보다 효율적으로 작업을 수행하는 능력을 평가한다.

성능 결과

최고 성능을 기록한 조합은 Gemini-3-Pro와 UI-Inst-7B를 결합한 경우로, 평균 정확도는 약 **52%**였다. 반면, 엔드투엔드(E2E) GUI 전용 모델들은 두 가지 새로운 평가 축에서 성능이 현저히 낮게 나타났다. 이는 복잡한 데이터 수집 및 대화형 작업에서 기존 GUI 에이전트의 한계를 드러낸다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.