Mistral 3.5 MLX 4비트 공개
Mistral medium 3.5 128B, MLX 4bit, ~70 GB
·2026.05.01 06:15
핵심 내용
Mistral Medium 3.5 128B MLX 4비트 변환본이 공개됐다.
자세히 보기
Mistral Medium 3.5 128B를 MLX 4비트로 양자화한 Apple Silicon용 변환본이 LM Studio와 Hugging Face에 게시됐다. Text, Vision, Thinking, Tool Calling을 지원하며 최소 ~72GB RAM이 필요하다고 안내한다.
- 원본은 FP8 static 133.6GB이고, 변환본은 4-bit affine, group_size=64 기준 약 70GB다.
- 비전 인코더는 BF16으로 유지되고,
projector와lm_head도 비양자화 상태이며, 비전 이해는 원본 FP8과 동일하다고 설명한다. - 아키텍처는 127.7B dense, 88층 텍스트 모델, 48층 Pixtral 비전 인코더, 262K 컨텍스트, 131K 토큰 vocab이다.
reasoning_effort="high"를 사용하면 [THINK]...[/THINK] 사고 블록이 출력되고, 네이티브 툴 호출도 지원한다.
다만 모든 런타임과 양자화에서 500~1000토큰 이후 반복 루프가 발생할 수 있어 repeat_penalty 1.1~1.15, top_k 20, max_tokens 제한을 권장한다.
mlx_vlm의 mistral3 sanitize 버그를 로컬 패치해 model.vision_tower.*와 model.multi_modal_projector.* 키 처리 문제를 수정했다고 덧붙였다.
라이선스는 Modified MIT이며, 월 매출 2,000만 달러까지 상업적 사용이 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.