AI Briefing

Continual Harness: ARC-AGI-3를 위한 효율적인 자기 개선 에이전트

·2026.07.02 09:00

Continual Harness는 기술 재사용과 자기 개선을 통해 ARC-AGI-3 벤치마크에서 매우 높은 효율성을 입증했다.

ARC-AGI-3는 에이전트의 지능을 측정하는 IQ 테스트로, 에이전트가 새로운 증거를 통해 규칙과 메커니즘을 이해하는 **내부 세계 모델(Internal World Model)**을 형성할 것을 요구합니다.

Continual Harness는 메모리 저장, 재사용 가능한 기술 작성, 서브 에이전트 배포 및 프롬프트 자체 수정을 지원하는 reset-free 자기 개선 에이전트 하네스입니다. 이 방식은 게임의 규칙이나 도구에 대한 사전 정보가 없는 극한의 환경에서도 작동하도록 설계되었습니다.

주요 성과는 다음과 같습니다:

  • 높은 효율성: ARC-AGI-3 공개 세트에서 단 $774의 비용으로 **20.54%**의 점수를 기록하며, 기존의 Hermes(8.25%, $5,674)나 OpenClaw(5.20%, $2,912)를 압도했습니다.
  • 기술 재사용: 전체 실행 액션의 **62%**가 새로운 추론이 아닌 저장된 기술(Saved Skills)에서 비롯되었습니다. 이는 상위 게임에서는 80%를 상회합니다.
  • 액션 최적화: Hermes가 완료된 레벨당 인간 기준 15.30배의 액션을 사용하는 반면, Continual Harness는 1.48배 수준의 액션만으로 목표를 달성했습니다.

결론적으로 Continual Harness는 유용한 계산 결과가 일회성 작업으로 끝나지 않고 하네스 상태의 일부로 통합됨으로써, 초기 탐색 단계에서 얻은 지식을 바탕으로 성능을 비약적으로 끌어올립니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.