AI Briefing

모델과 실행 틀의 적합성

·2026.05.05 09:00

같은 모델도 실행 틀에 따라 성능이 크게 달라진다고 분석했다.

실행 틀은 단순한 껍데기가 아니라 모델이 학습한 계약 자체로 다뤄진다. 같은 워크스테이션에서 Codex CLI, Claude Code, GitHub Copilot CLI를 돌려도 같은 프롬프트에 대한 동작이 달라지며, 이 차이는 model-harness-fit 문제로 묶인다.

Terminal-Bench 2.0에서도 차이는 분명하다. 2026년 4월 30일 기준 Claude Opus 4.6ForgeCode와 붙었을 때 79.8%, Capy와 붙었을 때 **75.3%**를 기록했고, Cursor는 실행 틀만 바꿔 자체 에이전트를 Top 30에서 Top 5로 끌어올렸다.

세 실행 틀의 계약 방식도 서로 다르다.

  • CodexSubmissionEvent를 주고받는 타입화된 비동기 프로토콜 위에서 동작하고, 크로스 프로세스용으로는 별도 JSON RPC 계층을 얹는다.
  • Claude CodeAssistantEvent 스트림을 처리하는 직접 대화 루프이며, edit_file 같은 도구 계약이 Codex의 apply_patch와 다르다.
  • GitHub Copilot CLI는 호스트가 자식 프로세스를 띄우는 감독자 프로토콜로, session.createsession.event로 에이전트를 제어한다.

도구 이름, 입력 스키마, citation 태그, 메모리 방식, 시스템 프롬프트 구조, CLAUDE.mdAGENTS.md 같은 identity file 규약까지 모두 맞물린다. 결론은 하나다. 모델만 교체하는 방식으로는 품질을 유지할 수 없고, 모델과 실행 틀은 한 쌍으로 맞춰야 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.