AI Briefing

GUI 에이전트 학습 방법론 및 데이터셋 공개

Smol2Operator: Post-Training GUI Agents for Computer Use

·2025.09.23 09:00

경량 VLM을 GUI 자동화 에이전트로 진화시키는 2단계 학습 방법론과 데이터셋을 공개했다.

GUI 자동화는 AI 에이전트가 모바일, 데스크톱, 웹 플랫폼을 탐색하기 위한 핵심 기술입니다. HuggingFace는 경량 시각-언어 모델(VLM)인 SmolVLM2-2.2B-Instruct를 활용해 GUI 이해 및 조작 능력을 부여하는 Smol2Operator 방법론을 발표했습니다.

이 방법론은 모델을 '인식' 단계에서 '인지' 단계로 진화시키는 2단계 학습 전략을 사용합니다:

  • Phase 1 (Perception): 모델이 GUI 요소의 위치를 정확히 파악하고 시각적 정보를 이해하도록 학습합니다.
  • Phase 2 (Cognition): 단순 인식을 넘어, 고수준의 작업을 저수준의 GUI 액션(클릭, 타이핑 등)으로 변환하여 실행하는 에이전트 능력을 부여합니다.

HuggingFace는 연구의 재현성을 위해 **데이터 변환 도구, 학습 레시피, 모델, 그리고 관련 데이터셋(aguvis-stage-1, aguvis-stage-2)**을 모두 오픈 소스로 공개했습니다. 이는 단순히 성능(SOTA)을 겨루는 것이 아니라, VLM의 GUI 접지(grounding) 능력을 어떻게 끌어올릴 수 있는지에 대한 전체 프로세스를 공유하는 데 목적이 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.