AI Briefing

Gemma4 31B MLX 혼합양자화

Gemma4-31B-3bit-mlx · Hugging Face: 3 & 5 mixed quant for RAM poor Mac users.

·2026.04.29 02:30

Gemma 4 31B를 3·5비트로 혼합 양자화한 MLX 변환본이 공개됐다.

leonsarmiento/gemma-4-31B-it-3bit-mlx가 Hugging Face에 등록됐다. google/gemma-4-31B-itmlx-lm 0.31.2로 변환한 MLX 버전으로, RAM이 부족한 Mac 환경을 겨냥했다.

  • 양자화 방식: embed_tokens만 5비트, 나머지 양자화 가능 레이어는 3비트
  • 그룹 크기: 64
  • 총 출력 크기: 약 13.8GB
  • 방식: mlx_lm.convert의 커스텀 quant_predicate 사용

권장 샘플링 설정도 함께 제시했다.

  • temperature 1.0
  • top_p 0.95
  • top_k 64
  • min_p 0.05
  • repeat_penalty 1.05

LM Studio에서 reasoning 출력을 파싱하려면 시작 문자열을 <|channel>thought, 종료 문자열을 <channel|>로 두고, ninja template에 enable_thinking = true를 넣으면 된다. 사용 예시는 pip install mlx-lmload()generate()를 호출하는 방식이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.