Gemma4 31B MLX 혼합양자화
Gemma4-31B-3bit-mlx · Hugging Face: 3 & 5 mixed quant for RAM poor Mac users.
·2026.04.29 02:30
Gemma 4 31B를 3·5비트로 혼합 양자화한 MLX 변환본이 공개됐다.
leonsarmiento/gemma-4-31B-it-3bit-mlx가 Hugging Face에 등록됐다. google/gemma-4-31B-it을 mlx-lm 0.31.2로 변환한 MLX 버전으로, RAM이 부족한 Mac 환경을 겨냥했다.
- 양자화 방식:
embed_tokens만 5비트, 나머지 양자화 가능 레이어는 3비트 - 그룹 크기: 64
- 총 출력 크기: 약 13.8GB
- 방식:
mlx_lm.convert의 커스텀quant_predicate사용
권장 샘플링 설정도 함께 제시했다.
- temperature 1.0
- top_p 0.95
- top_k 64
- min_p 0.05
- repeat_penalty 1.05
LM Studio에서 reasoning 출력을 파싱하려면 시작 문자열을 <|channel>thought, 종료 문자열을 <channel|>로 두고, ninja template에 enable_thinking = true를 넣으면 된다. 사용 예시는 pip install mlx-lm 뒤 load()와 generate()를 호출하는 방식이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.