SkillOS: 자기진화형 에이전트를 위한 스킬 큐레이션 학습
·2026.05.11 09:00
Google 연구진이 경험 기반 RL로 스킬 큐레이션을 학습하는 SkillOS를 제안했다.
SkillOS는 LLM 기반 에이전트가 과거 경험에서 스킬을 축적하고 선별하도록 만드는 경험 기반 RL 레시피다. 기존처럼 수동 큐레이션이나 짧은 구간의 스킬 운영에 의존하면, 지연된 피드백이 섞인 장기 정책을 배우기 어렵다는 문제를 겨냥한다.
핵심은 실행과 큐레이션의 분리다. frozen agent executor는 외부 SkillRepo에서 스킬을 검색해 적용하고, trainable skill curator는 누적 경험을 바탕으로 SkillRepo를 갱신한다. 실행은 고정한 채 무엇을 남기고 어떻게 다듬을지에만 학습을 집중시킨다.
- 학습 신호는 composite rewards와 스킬 의존성을 반영한 grouped task streams로 만든다.
- 앞선 태스크의 궤적이 SkillRepo를 업데이트하고, 뒤따르는 관련 태스크가 그 변경의 효과를 평가한다.
- 이런 구조로 장기적인 스킬 큐레이션 정책을 직접 학습한다.
실험에서는 다중 턴 에이전트 작업과 단일 턴 추론 작업 모두에서 SkillOS가 메모리 없는 베이스라인과 강한 메모리 기반 베이스라인을 일관되게 앞섰다. 이 curator는 서로 다른 executor 백본과 작업 도메인으로도 잘 일반화됐고, 더 목표 지향적인 스킬 사용을 유도했다.
시간이 지날수록 SkillRepo의 스킬 문서는 더 구조화된 Markdown 형태로 진화했다. 단순한 작업 지시문이 아니라 상위 수준의 메타스킬을 담는 저장소로 바뀌는 셈이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.