AI Briefing

hip-agent: 프롬프트에 포함되는 하네스 (5분 읽기)

·2026.09.06 09:00

핵심 내용

프롬프트 내장형 하네스 hip-agent가 Codex CLI와 유사한 성능을 달성하며 모델 평가 도구로 활용 가능성을 제시했다.

자세히 보기

기존 코딩 하네스는 인간 사용자 중심이라 에이전트가 서브 에이전트로 활용하기 어려웠다. hip-agent는 이를 해결하기 위해 설계된 '프롬프트 내장 하네스'로, Python 약 200줄과 Codex API 모듈 하나로 구성된다.

핵심 설계 원칙

  1. 프롬프트 내장: 모델이 하네스의 소스 코드를 읽고 동작을 이해하도록 지시하며, sh와 view_image 두 가지 도구만 제공한다.
  2. OS 런타임 활용: 설정은 환경 변수, 동작은 셸 명령어, 서브 에이전트는 자식 프로세스로 구현해 복잡도를 낮췄다.
  3. 기존 프로토콜 준수: Agent Plugins 규격과 Claude Code의 hook contract을 따르며, Codex CLI 세션 파일 형식을 지원한다.

벤치마크 결과 DeepSWE 113개 태스크 평가에서 hip-agent는 Codex CLI 0.147.0과 대등한 성능을 보였다.

  • 해결률: hip-agent 64.6% (73/113) vs Codex CLI 63.7% (72/113)
  • 모델 호출 수: hip-agent 187회 vs Codex CLI 208회
  • 실행 시간: hip-agent 58분 vs Codex CLI 52분

의미 및 한계 hip-agent는 고정된 하네스가 모델 성능 향상의 병목이 될 수 있다는 문제의식에서 출발했다. 모델이 하네스를 읽고 수정할 수 있어(repairable) 향후 모델이 직접 태스크에 맞는 하네스를 구축하는 훈련에 활용될 수 있다. 다만, 각 1회 실행 결과로 오차 범위는 없으며, hip-agent는 토큰 사용량을 로깅하지 않아 해당 지표는 비교되지 않았다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.