Continual Harness 공개
Continual Harness: Online Adaptation for Self-Improving Foundation Agents [R]
·2026.05.14 12:45
자기개선형 에이전트용 온라인 적응 하니스 논문이 공개됐다.
Continual Harness는 최소한의 환경 인터페이스만 둔 채, 에이전트가 실행 중에 프롬프트·스킬·메모리·서브에이전트를 계속 갱신하는 reset-free 적응 루프다.
**GPP(Gemini Plays Pokémon)**는 Blue, Yellow Legacy 하드 모드, Crystal을 무패로 클리어하는 과정에서 인간이 하던 harness 편집이 define_agent, run_code, notepad 같은 메타 도구로 점점 모델 주도로 넘어갔다.
- Pokemon Red/Emerald 평가에서 frontier models 기준 버튼 입력 비용을 낮추고, 수작업 expert harness와의 격차를 상당 부분 줄였다.
- process-reward co-learning으로 오픈소스 에이전트의 롤아웃을 frontier teacher가 재라벨링해 모델을 업데이트했고, Pokemon Red에서 재시작 없이 지속적 진전을 보였다.
논문은 장기 에이전트의 성능이 모델 단독이 아니라 하니스 자체의 자기개선에 달려 있다는 메시지를 낸다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.