AI Briefing

다양한 모델과 작업에 걸친 GitHub Copilot 에이전트 하네스의 성능 및 효율성 평가

·2026.06.26 07:59

GitHub Copilot 에이전트 하네스가 다양한 LLM 모델과 벤치마크에서 보여주는 성능 및 효율성을 분석한다.

LLM이 원천 지능을 제공한다면, **harness(하네스)**는 그 지능이 얼마나 효과적으로 적용되는지를 결정한다. GitHub Copilot SDK의 핵심 구성 요소인 GitHub Copilot agentic harness는 도구, 컨텍스트, 워크플로우를 조율하며, 개발자에게 빠르고 토큰 효율적이며 예측 가능한 환경을 제공하도록 설계되었다.

GitHub은 Claude Sonnet 4.6, Claude Opus 4.7, GPT-5.4, GPT-5.5 등 주요 모델을 대상으로 하네스의 성능을 지속적으로 평가한다. 비교를 위해 동일한 모델과 벤치마크 작업을 사용하며, 컨텍스트 윈도우, 추론 노력, 도구 선택 등을 정규화하여 모델 제조사의 자체 하네스(Claude Code, Codex CLI)와 비교한다.

평가에는 다음과 같은 주요 벤치마크가 포함된다:

  • SWE-bench Verified/Pro: 오픈소스 Python 저장소 기반의 버그 수정 및 복잡한 엔지니어링 작업 수행 능력 측정
  • SkillsBench: 에이전트의 기술 사용 및 트리거링 능력 평가
  • TerminalBench: 터미널 기반 워크플로우에서의 성능 측정
  • Win-Hill: Windows 컨테이너 환경에서의 범용성 검증

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.