AI Briefing

VS Code, VSC-Bench 공개

Harness optimization in VS Code

·2026.05.16 01:20

VS Code가 Copilot harness 최적화와 VSC-Bench 평가체계를 공개했다.

VS Code 팀이 Copilot 에이전트에서 model보다 중요한 harness를 어떻게 다듬는지 공개했다.

harness는 요청 전 context assembly, 모델이 호출할 tool exposure, 결과를 처리하는 tool execution을 맡는다. 모델별로 시스템 프롬프트와 툴 세트, 루프 동작도 다르게 조정하며, 새 모델은 단순 추가가 아니라 출시 전 재검증 대상이다.

공개 벤치마크는 기준선으로 쓰지만, 프론티어 모델의 오염 우려와 실제 편집기 워크플로 커버리지 한계 때문에 자체 평가가 필요하다고 본다.

  • SWE-bench Verified는 오염 가능성이 있고,
  • Terminal-Bench는 실제 VS Code 개발 흐름과는 다른 단일 과제 성격이 강하다.

대안으로 VS Code는 VSC-Bench라는 오프라인 평가 세트를 만들었다.

  • 대상: custom agent modes, extension workflows, MCP/tool use, terminal/browser interaction, multi-turn conversations
  • 작업군: TypeScript, Python, C++ 등 멀티랭귀지 코딩 태스크
  • 지표: solution correctness, agent effort, token efficiency, latency
  • 예시 차트는 40회 실행, 8개 구성을 비교했으며, xhighhigh보다 토큰을 더 쓰면서도 해법 수는 약간 낮았다.

하니스 관련 PR에는 ~requires-eval-assessment 라벨을 붙여 자동 평가를 돌리고, 결과를 PR에 다시 붙이는 흐름도 운영한다. 출시 후에는 A/B 테스트, aggregate usage signals, weekly reporting으로 지속 측정하며, VS Code는 앞으로도 model 업데이트와 함께 harness 개선을 배포한다고 밝혔다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.