AI Briefing

M2.7, M2.5에 밀림

MiniMax2.7 Local Results on Terminal Bench. Dud. Anyone using this for agent coding in Claude?

·2026.04.21 07:29

Terminal-Bench 2.0에서 MiniMax M2.7은 41.3%로 M2.5보다 낮았다.

Terminal-Bench 2.0 전체 445회 시험에서 MiniMax-M2.7(Q8_0, unsloth GGUF)을 Mac Studio M3 Ultra 512GB에서 로컬로 돌린 결과, 평균 성능은 **41.3%**였다.

  • 184 solved / 250 failed
  • 198 errors187개가 AgentTimeoutError
  • 생성 속도는 10~17 tok/s

같은 하드웨어와 구성에서 이전 버전 **M2.5는 42.7%**를 기록해, M2.7이 오히려 더 낮았다. 타임아웃도 166건 → 187건으로 늘어, 더 느린 생성 속도 때문에 작업이 제한 시간 안에 끝나지 못한 것으로 해석된다.

실행 환경은 llama.cpp build 8680, Metal GPU offload, 그리고 claude-proxy를 Claude Code와 llama-server 사이에 둔 구조였다. llama-server는 Anthropic Messages API를 직접 받아 로컬 모델을 에이전트처럼 구동했다.

핵심 결론은 M2.7이 Apple Silicon에서 agentic coding용으로 M2.5 대비 명확한 개선을 보여주지 못했다는 점이다. 여기에 출시 시점의 licensing 혼선까지 겹쳐, 추가 투자 유인이 약했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.