AI Briefing

llama.cpp MiMo V2.5 지원

feat: Add Mimo v2.5 model support by AesSedai · Pull Request #22493 · ggml-org/llama.cpp

·2026.05.07 20:23

llama.cpp가 MiMo V2.5 모델 지원 PR을 올렸다.

ggml-org/llama.cpp의 PR #22493이 **MiMo V2.5(+ Pro)**의 text-to-text inference 지원을 추가했다. 비-Pro 모델의 audio·vision 구성은 이번 범위에서 제외됐다.

  • 작성자는 Pro 모델을 아직 다시 검증하지 않았지만, 변환·양자화는 정상일 것으로 봤다.
  • convert_hf_to_gguf.pyFP8 safetensors를 올바르게 dequantize하도록 수정됐다.
  • MiMo의 TP-aware sharding과 fused attention_qkv는 기존 MiMo V2 Flash 경로와 맞추기 위해 다시 분리했다.
  • config.jsonattention_value_scale도 GGUF 변환 경로에 연결해 transformers 구현과의 차이를 줄였다.

Q8_0 검증에서는 Mean PPL(Q) 5.135221와 base 5.128919가 거의 같았고, Mean KLD 0.012455로 양자화 오차가 작았다.

댓글에서는 GGUFWriter.add_attn_value_scale 누락으로 변환 에러가 나왔지만, 작성자가 수정 커밋을 추가해 보완했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.