AI Briefing

AI 자가 개선 벤치마크 공개

Can AI Improve Itself? RSI Might Be the Answer [R]

·2026.08.28 05:13

핵심 내용

Scale AI가 AI 에이전트의 자가 개선 능력을 측정하는 HarnessOpt-Bench를 공개했다.

자세히 보기

Scale AI 팀이 AI가 다른 AI 에이전트를 얼마나 잘 개선하는지 측정하기 위해 HarnessOpt-Bench를 도입했다. 이 벤치마크는 평가 대상이 샌드박스 외부에 격리되어 있어, 최적화 에이전트가 답을 훔치거나 치팅하는 것을 구조적으로 차단한다.

주요 연구 결과

  • 모델 선택의 영향: 동일한 코딩 하네스를 사용했을 때, Claude Opus 5가 4개 태스크 중 3개에서 최상위 성능을 기록했다.
  • 하네스 선택의 영향: 동일한 모델을 사용하더라도 자체 하네스보다 OpenCode가 20개 모델-태스크 조합 중 11개에서 더 나은 결과를 보였다.
  • 핵심 인사이트: 모델 변경으로 인한 성능 향상 효과가 하네스 변경 효과보다 1.8배 더 컸다.

이 연구는 5개 프런티어 모델과 4개 다운스트림 태스크, 총 111회 실행을 통해 검증되었으며, 관련 논문과 코드는 공개되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.