AI Briefing

모델과 실행 틀의 적합성

·2026.05.05 09:00

핵심 내용

같은 모델도 실행 틀에 따라 성능이 크게 달라진다고 분석했다.

자세히 보기

실행 틀은 단순한 껍데기가 아니라 모델이 학습한 계약 자체로 다뤄진다. 같은 워크스테이션에서 Codex CLI, Claude Code, GitHub Copilot CLI를 돌려도 같은 프롬프트에 대한 동작이 달라지며, 이 차이는 model-harness-fit 문제로 묶인다.

Terminal-Bench 2.0에서도 차이는 분명하다. 2026년 4월 30일 기준 Claude Opus 4.6은 ForgeCode와 붙었을 때 79.8%, Capy와 붙었을 때 **75.3%**를 기록했고, Cursor는 실행 틀만 바꿔 자체 에이전트를 Top 30에서 Top 5로 끌어올렸다.

세 실행 틀의 계약 방식도 서로 다르다.

  • Codex는 Submission과 Event를 주고받는 타입화된 비동기 프로토콜 위에서 동작하고, 크로스 프로세스용으로는 별도 JSON RPC 계층을 얹는다.
  • Claude Code는 AssistantEvent 스트림을 처리하는 직접 대화 루프이며, edit_file 같은 도구 계약이 Codex의 apply_patch와 다르다.
  • GitHub Copilot CLI는 호스트가 자식 프로세스를 띄우는 감독자 프로토콜로, session.create와 session.event로 에이전트를 제어한다.

도구 이름, 입력 스키마, citation 태그, 메모리 방식, 시스템 프롬프트 구조, CLAUDE.md와 AGENTS.md 같은 identity file 규약까지 모두 맞물린다. 결론은 하나다. 모델만 교체하는 방식으로는 품질을 유지할 수 없고, 모델과 실행 틀은 한 쌍으로 맞춰야 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.