AI Briefing

로컬 코딩 모델 실무 수준 도달

Local model on coding has reached a certain threshold to be feasible for real work

·2026.04.28 10:32

핵심 내용

Terminal-Bench 2.0에서 27B~32B 오픈웨이트 코딩 모델이 최대 38.2%를 기록했다.

1 / 2

자세히 보기

27B~32B 오픈웨이트 코딩 모델을 Terminal-Bench 2.0(89 tasks)에서 평가한 결과, Qwen 3.6-27B가 기본 per-task timeout 기준 **38.2% (34/89)**로 최고점을 기록했다.

  • 비교 기준은 공개 리더보드와 같은 default setup이다.
  • 작성자는 이 수치를 검증된 리더보드와 맞춰 비교했다고 밝혔다.
  • MOE 모델은 추론 속도에서 여전히 한 자릿수 자릿수 이상의 개선 여지가 있다고 언급했다.

공개 리더보드의 검증된 SOTA는 약 80% 수준이며, 글에서는 최신 런너블 오프라인 모델의 성능이 2025년 후반의 hosted frontier와 비슷한 수준이라고 해석했다.

  • Terminus 2 + Claude Opus 4.1: 38.0%
  • Terminus 2 + GPT-5.1-Codex: 36.9%
  • Claude Code + Sonnet 4.5: 40.1%
  • Codex CLI + GPT-5-Codex: 44.3%

글의 결론은, 오프라인/온프레미스/규제 환경에서 실행 가능한 코딩 모델이 실무 투입 가능한 경계에 처음으로 근접했다는 점이다. 저자들은 이를 대략 6~8개월의 성능 격차로 요약했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.