로컬 코딩 모델 실무 수준 도달
Local model on coding has reached a certain threshold to be feasible for real work
·2026.04.28 10:32
Terminal-Bench 2.0에서 27B~32B 오픈웨이트 코딩 모델이 최대 38.2%를 기록했다.
27B~32B 오픈웨이트 코딩 모델을 Terminal-Bench 2.0(89 tasks)에서 평가한 결과, Qwen 3.6-27B가 기본 per-task timeout 기준 **38.2% (34/89)**로 최고점을 기록했다.
- 비교 기준은 공개 리더보드와 같은 default setup이다.
- 작성자는 이 수치를 검증된 리더보드와 맞춰 비교했다고 밝혔다.
- MOE 모델은 추론 속도에서 여전히 한 자릿수 자릿수 이상의 개선 여지가 있다고 언급했다.
공개 리더보드의 검증된 SOTA는 약 80% 수준이며, 글에서는 최신 런너블 오프라인 모델의 성능이 2025년 후반의 hosted frontier와 비슷한 수준이라고 해석했다.
- Terminus 2 + Claude Opus 4.1: 38.0%
- Terminus 2 + GPT-5.1-Codex: 36.9%
- Claude Code + Sonnet 4.5: 40.1%
- Codex CLI + GPT-5-Codex: 44.3%
글의 결론은, 오프라인/온프레미스/규제 환경에서 실행 가능한 코딩 모델이 실무 투입 가능한 경계에 처음으로 근접했다는 점이다. 저자들은 이를 대략 6~8개월의 성능 격차로 요약했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.