llama.cpp SarvamMoE 지원
model: add sarvam_moe architecture support by sumitchatterjee13 · Pull Request #20275 · ggml-org/llama.cpp
·2026.05.10 03:46
핵심 내용
llama.cpp에 Sarvam 전용 MoE 아키텍처 지원 PR이 올라왔다.
자세히 보기
llama.cpp PR #20275가 sarvam_moe 전용 경로를 추가했다.
BailingMoeForCausalLM를 기반으로 Sarvam-30B용 구조를 확장했다.- 19개 레이어 구성: 1개 dense FFN + 18개 MoE 레이어, 128개 routed expert, top-6, shared expert 1개.
- sigmoid gating, zero-mean expert bias 정규화,
routed_scaling_factor=2.5를 반영했다. - GQA(64 heads, 4 KV heads), 결합 QKV projection, QK RMSNorm도 포함됐다.
- 토크나이저는 SentencePiece BPE를 GPT-2 byte-level encoding으로 변환하도록 처리했다.
공식 Sarvam GGUF는 기존 bailingmoe2 경로로도 로드되지만, 이 PR은 Sarvam 전용 아키텍처와 변환 로직을 따로 넣어 정확한 RoPE, expert bias, 토크나이저 처리를 맞추는 데 초점이 있다. 테스트에서는 HF safetensors 변환, 여러 양자화(Q8_0/Q6_K/Q4_K_M), 추론 동작이 확인됐다. 다만 5월 8일 댓글에서 Indic 스크립트와 영어 토크나이저 정합성 문제가 지적됐고, 유지보수자는 master 리베이스를 요청했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.