Replit Agent, 사이드킥 아키텍처 11~16포인트 격차로 제압... Astra 대비 파레토 효율 달성
핵심 내용
Replit Agent이 사이드킥 아키텍처를 11~16포인트 차이로 제치고 Astra 대비 파레토 효율성을 입증했다.
자세히 보기
Replit Agent이 정적 라우팅을 대체하고, 코어 모델이 노력 수준, 작업 위임, 전문가 할당을 직접 결정하는 새로운 하네스 설계를 도입했다. DeepSWE v1.1 벤치마크에서 Replit Agent은 태스크당 $2.11 비용으로 72% 점수를 기록해, 태스크당 $1.34에 61%를 기록한 사이드킥 아키텍처보다 11포인트 높았다. Terminal-Bench 4.0에서는 태스크당 $2.53 비용으로 49% 점수를 달성해, 태스크당 $1.84에 33%를 기록한 사이드킥 아키텍처보다 16포인트 앞섰다. Astra 기준선 대비 Replit Agent은 파레토 효율성을 입증했다. Astra의 저노력 설정은 점수가 낮지만(DeepSWE 67%, Terminal-Bench 42%) 비용이 적고, 고노력 설정은 점수가 높지만(DeepSWE 74%, Terminal-Bench 60%) 비용이 두 배 이상 든다. Astra 기준선 중 비용과 점수 모두에서 동시에 우위를 점하는 설정은 없다.
위임을 위한 조합 가능한 프리미티브
하네스는 코어 루프를 위해 네 가지 프리미티브를 제공한다:
- 도메인 인식 서브에이전트: 탐색, 테스트, 리뷰, 디자인 전문가가 해당 분야에 가장 강력한 모델에서 실행된다.
- 서브에이전트 티어 및 노력: 코어 루프가 소형, 표준, 대형 티어를 선택하고 노력 수준을 동적으로 조정한다.
- 재사용 가능한 서브에이전트: 모델이 이전에 브리핑된 서브에이전트로 돌아가 최신 모델의 더 긴 캐시 수명을 활용한다.
- 동적 노력 조정: 태스크 난이도에 따라 턴 중간에 노력 수준을 조정하는 에스컬레이션 시스템으로, GPT-6 Astra 및 Fable 5.1 같은 모델의 캐시를 보존한다.
모델별 위임 행동 패턴
프로덕션 데이터는 뚜렷한 위임 패턴을 보여준다. GPT-6 Astra는 일반 워커에게 작업을 위임하는 비율이 20%(턴 기준)이며, 기존 서브에이전트로 돌아가는 비율이 42%(디스패치 기준)다. 반면 Fable 5와 Fable 5.1은 일반 워커에게 작업을 넘기는 비율이 각각 **0.9%**와 **2.3%**로 낮아, 구현 작업을 직접 수행하는 것을 선호한다.
하네스 설계의 쓰라린 교훈(Bitter Lesson)
Replit은 조합 가능한 하네스가 모델의 능력 향상에 따라 확장될 수 있게 한다고 주장하며, 이는 인간이 설계한 휴리스틱보다 일반적 방법이 결국 더 나은 성과를 낸다는 Sutton의 **쓰라린 교훈(bitter lesson)**과 일치한다. 모델이 실행 전략을 스스로 발견하도록 함으로써 Replit Agent은 경직된 아키텍처보다 더 나은 결과를 달성한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.