오픈 모델이 임계점을 넘었다
핵심 내용
GLM-5와 MiniMax M2.7이 핵심 에이전트 작업에서 폐쇄형 모델급 성능을 냈다.
자세히 보기
GLM-5와 MiniMax M2.7 같은 오픈 weight LLM이 파일 작업, tool use, instruction following 같은 핵심 에이전트 과제에서 폐쇄형 frontier 모델과 비슷한 성능에 도달했다. LangChain의 Deep Agents eval 결과, 이제 오픈 모델은 비용과 지연시간 측면에서 실전 배포 옵션이 될 만한 수준에 올라섰다.
오픈 모델을 보는 기준은 cost, latency, task performance다. 기사에서는 폐쇄형 frontier 모델이 고처리량 환경에서 8~10배 더 비쌀 수 있고, 응답 지연도 더 길다고 짚는다. 예를 들어 10M tokens/day를 출력하는 애플리케이션은 Opus 4.6에서 하루 약 $250, MiniMax M2.7에서는 약 $12 수준으로, 연간 차이는 대략 $87k에 달한다.
성능 측정은 7개 eval 범주로 진행됐다.
- file operations, tool use, retrieval, conversation, memory, summarization, unit tests
- 성공 기준은 correctness와 efficiency를 함께 본다
- 지표는 correctness, solve rate, step ratio, tool call ratio로 구성된다
결과는 오픈 모델이 이미 충분히 경쟁적이라는 점을 보여준다. GLM-5는 0.64 correctness(94/138), MiniMax M2.7은 0.57 correctness(85/138)를 기록했다. 비교 대상인 frontier 모델은 Claude Opus 4.6 0.68, Gemini 3.1 Pro Preview 0.65, GPT-5.4 0.61로, 격차가 크지 않았다. 특히 GLM-5는 file ops와 retrieval, unit test에서 1.0을 기록했고, latency 측면에서도 OpenRouter 데이터 기준 0.65s / 70 tokens/s로 Claude Opus 4.6의 2.56s / 34 tokens/s보다 빨랐다.
이 결과를 바탕으로 Deep Agents는 오픈 모델 사용을 쉽게 만들었다. 모델 변경은 한 줄이면 되고, 하네스가 컨텍스트 윈도우, 지원되지 않는 modality, 모델 identity를 자동으로 맞춘다.
- SDK에서는
baseten:zai-org/GLM-5,openrouter:minimax/minimax-m2.7처럼 바로 교체 가능 - CLI에서는
/model명령으로 세션 중간에 모델을 바꿀 수 있다 - planning은 frontier model, execution은 open model처럼 역할 분담도 가능하다
기사는 앞으로 open model family별 harness tuning, 그리고 frontier orchestrator + open subagents 같은 멀티모델 구성도 더 실험할 예정이라고 밝힌다. 핵심 메시지는 분명하다. 오픈 모델은 더 이상 보조재가 아니라, 에이전트 워크플로의 실사용 옵션이 됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.