AI Briefing

Apple, 장기 에이전트 훈련용 SCLATE 공개… 한 달 시나리오를 몇 시간으로 압축

·2026.09.30 09:00

핵심 내용

Apple이 장기 에이전트 훈련용 SCLATE를 공개해 한 달 시나리오를 몇 시간으로 압축했다.

자세히 보기

Apple 연구진이 장기 다중 세션 환경에서 지속 학습 에이전트를 훈련하고 평가하기 위한 실행 기반인 SCLATE를 공개했다. 기존 벤치마크는 세션 종료, 크론, 메모리 통합 등 에이전트 측 이벤트를 적절히 교차 처리하지 못해 개발자가 자체 스케줄링 루프를 구축해야 했다. SCLATE는 어댑터를 통해 벤치마크와 수정되지 않은 에이전트가 단일 오픈 스케줄러에 이벤트를 추가할 수 있도록 한다.

효율적인 시뮬레이션 및 롤아웃

이 시스템은 에이전트가 작업하는 동안에는 실시간으로 흐르되 유휴 시간 간격은 건너뛰는 하이브리드 시뮬레이션 클록을 사용하여 이벤트를 공유 타임라인에서 실행한다. 이 방식으로 한 달 분량의 시나리오를 몇 시간으로 압축한다. SCLATE는 롤아웃 엔진으로도 작동하며, 컨테이너 내 프록시를 통해 모든 모델 호출의 토큰과 로그 확률을 기록하면서 수정되지 않은 에이전트 하네스와 메모리를 실행한다.

벤치마킹 및 후속 학습 결과

연구팀은 7개 벤치마크를 SCLATE로 포팅하고 10개 모델에서 수정되지 않은 10가지 하네스 및 메모리 구성을 비교했다. 주요 발견 사항은 다음과 같다.

  • 추가된 메모리 시스템이 하네스의 기본 메모리보다 일관되게 더 나은 성능을 내지 않는다.
  • 모델마다 동일한 하네스와 메모리를 활용하는 방식에 큰 차이가 있다.

연구팀은 수정되지 않은 하네스와 메모리 시스템을 사용하여 Qwen3.5-4B를 후속 학습했다. 이 모델은 두 시스템을 효과적으로 사용하는 법을 학습했으며, 그 결과:

  • 파일 읽기 줄 수가 6.8배 감소했다.
  • SWE-bench Verified 통과율이 16.7포인트 상승했다.
  • 홀드아웃 MetaClaw 정확도가 최대 11.8포인트 향상되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.