AI Briefing

M2.7, M2.5에 밀림

MiniMax2.7 Local Results on Terminal Bench. Dud. Anyone using this for agent coding in Claude?

·2026.04.21 07:29

핵심 내용

Terminal-Bench 2.0에서 MiniMax M2.7은 41.3%로 M2.5보다 낮았다.

자세히 보기

Terminal-Bench 2.0 전체 445회 시험에서 MiniMax-M2.7(Q8_0, unsloth GGUF)을 Mac Studio M3 Ultra 512GB에서 로컬로 돌린 결과, 평균 성능은 **41.3%**였다.

  • 184 solved / 250 failed
  • 198 errors 중 187개가 AgentTimeoutError
  • 생성 속도는 10~17 tok/s

같은 하드웨어와 구성에서 이전 버전 **M2.5는 42.7%**를 기록해, M2.7이 오히려 더 낮았다. 타임아웃도 166건 → 187건으로 늘어, 더 느린 생성 속도 때문에 작업이 제한 시간 안에 끝나지 못한 것으로 해석된다.

실행 환경은 llama.cpp build 8680, Metal GPU offload, 그리고 claude-proxy를 Claude Code와 llama-server 사이에 둔 구조였다. llama-server는 Anthropic Messages API를 직접 받아 로컬 모델을 에이전트처럼 구동했다.

핵심 결론은 M2.7이 Apple Silicon에서 agentic coding용으로 M2.5 대비 명확한 개선을 보여주지 못했다는 점이다. 여기에 출시 시점의 licensing 혼선까지 겹쳐, 추가 투자 유인이 약했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.