AI Briefing

오푸스 4.7 반등

Kimi K2.6-Code-Preview, Opus 4.7, GLM 5.1, Minimax M2.7 and more tested in coding

·2026.04.17 11:35

핵심 내용

Opus 4.7은 확실히 개선됐고, Kimi K2.6-Code-Preview는 아직 보류다.

자세히 보기

145개 결과를 새·구버전 리더보드에 걸쳐 쌓은 코딩 평가를 추가했다.

이번 패스에서 테스트한 모델은 Kimi K2.6-Code-Preview, Opus 4.7, GLM 5.1, Minimax M2.7 등이다.

핵심 소감은 다음과 같다.

  • Opus 4.7은 최근 업그레이드들 중 드물게 실질적인 개선을 보였다.
  • Kimi K2.6-Code-Preview는 아직 크게 더 좋아졌다고 느껴지지 않아, 다른 에이전트 환경에서 더 써 본 뒤 판단을 유보했다.
  • GLM 5.1은 꽤 좋았고, 저자는 일부 오픈웨이트 모델이 과장된 주장과 달리 여전히 Opus/GPT 급에는 못 미친다고 본다.
  • 상위권에는 Kimi K2.5와 GLM 5.1이 있고, 이들이 Gemini/Sonnet 수준에 근접했을 수 있다고 평가했다.
  • 중간권으로는 Minimax M2.7과 Qwen 3.6 Plus를 꼽았고, 가격이나 로컬 실행 가능성 측면에선 여전히 매력적이라고 봤다.

또 다른 포인트는 ForgeCode다.

  • Minimax M2.7에서 가장 높은 점수를 기록했다.
  • 다만 UX/DX가 OpenCode와 매우 달라 추천은 어렵다고 했다.
  • Zsh 플러그인 형태라 이런 형태를 선호하는 사용자에겐 맞을 수 있지만, 당시엔 다른 모델/프로바이더에서 거의 다 깨지는 등 버그가 많아 당장 쓰기엔 이르다고 정리했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.