에이전트 학습을 위한 합성 컴퓨터 환경
·2026.05.04 09:00
사용자별 합성 컴퓨터를 대량 생성해 장기 업무 에이전트를 훈련한다.
Synthetic Computers at Scale는 사용자별 실제 작업 환경을 닮은 합성 컴퓨터를 대량 생성해, 장기 생산성 작업을 시뮬레이션하는 데이터 생성 방법을 제안한다. 디렉터리 구조를 실제처럼 구성하고, 문서·스프레드시트·프레젠테이션 같은 콘텐츠가 풍부한 아티팩트를 채워 넣어 에이전트가 맥락을 읽고 작업을 이어가게 만든다.
시뮬레이션은 두 에이전트의 역할 분담으로 돌아간다.
- 하나의 에이전트가 특정 사용자에 맞는 생산성 목표를 만든다. 이 목표는 여러 개의 전문 산출물을 요구하고, 인간 기준 약 한 달 분량의 작업이 필요하도록 설계된다.
- 다른 에이전트는 그 사용자 역할로 컴퓨터를 사용하며 파일시스템을 탐색해 grounding을 확보하고, 시뮬레이션된 협업자와 조율하며, 목표가 끝날 때까지 아티팩트를 생산한다.
초기 실험에서는 1,000개의 합성 컴퓨터를 만들었고, 각 시뮬레이션은 8시간 이상의 에이전트 런타임과 평균 2,000턴 이상을 기록했다. 이렇게 얻은 경험 신호는 in-domain과 out-of-domain 생산성 평가 모두에서 유의미한 성능 향상으로 이어졌으며, 저자들은 페르소나가 대규모로 존재하는 만큼 이 접근이 수백만, 나아가 수십억 개 환경까지 확장될 수 있다고 본다.
결국 이 방법은 장기 생산성 작업에서 에이전트 자기개선과 agentic reinforcement learning의 기반이 될 수 있다는 주장으로 이어진다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.