llama.cpp MiMo V2.5 지원
feat: Add Mimo v2.5 model support by AesSedai · Pull Request #22493 · ggml-org/llama.cpp
·2026.05.07 20:23
llama.cpp가 MiMo V2.5 모델 지원 PR을 올렸다.
ggml-org/llama.cpp의 PR #22493이 **MiMo V2.5(+ Pro)**의 text-to-text inference 지원을 추가했다. 비-Pro 모델의 audio·vision 구성은 이번 범위에서 제외됐다.
- 작성자는
Pro모델을 아직 다시 검증하지 않았지만, 변환·양자화는 정상일 것으로 봤다. convert_hf_to_gguf.py가 FP8 safetensors를 올바르게 dequantize하도록 수정됐다.- MiMo의 TP-aware sharding과 fused
attention_qkv는 기존 MiMo V2 Flash 경로와 맞추기 위해 다시 분리했다. config.json의attention_value_scale도 GGUF 변환 경로에 연결해 transformers 구현과의 차이를 줄였다.
Q8_0 검증에서는 Mean PPL(Q) 5.135221와 base 5.128919가 거의 같았고, Mean KLD 0.012455로 양자화 오차가 작았다.
댓글에서는 GGUFWriter.add_attn_value_scale 누락으로 변환 에러가 나왔지만, 작성자가 수정 커밋을 추가해 보완했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.