스마트폰에서 GUI 에이전트 실행에 관한 문헌 리뷰: AndroidWorld
·2026.09.02 16:19
핵심 내용
기존 정적 벤치마크의 한계를 극복한 파라미터화 태스크 기반 안드로이드 에이전트 벤치마크 AndroidWorld가 공개됐다.
자세히 보기
기존 안드로이드 에이전트 벤치마크들은 고정된 태스크와 스크린샷을 반복 사용하며 '암기 테스트'에 그쳤다는 지적이 이어져 왔다. 이를 해결하기 위해 공개된 AndroidWorld는 파라미터화된 태스크 템플릿을 도입해 매 실행마다 변수가 변경되는 수백만 개의 고유 태스크 변형을 생성한다.
벤치마크 구조 및 평가 방식
AndroidWorld는 실제 안드로이드 에뮬레이터 환경에서 20개 앱에 걸친 116개 태스크를 수행한다. 인간 평가자 없이 **ADB(Android Debug Bridge)**를 통해 OS 상태를 직접 검사하는 initialize(), is_successful(), tear_down() 함수를 내장해 완전한 재현성을 확보했다.
성능 결과 및 시사점
Gemini 1.5 Pro, GPT-4 Turbo, Gemma 2 27B 등을 기반으로 한 신규 에이전트 M3A의 성능은 다음과 같다.
- AndroidWorld: M3A 30.6%, SeeAct 15.5%, 인간 80.0%
- MobileMiniWoB++: M3A 약 68%, 인간 100%
- 지연 시간: M3A는 태스크당 평균 3.9분 소요로 인간보다 3배 느림
특히 고정된 시드(seed) 사용 시 특정 태스크에서 0%의 성공률을 보이다가, 시드를 변경하면 정상적으로 해결되는 현상이 발견되어 기존 정적 벤치마크가 운에 따른 파라미터 조합을 측정했을 가능성을 시사했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.