SuperGemma4 - Google Gemma 4 26B의 비검열/속도 개선/양자화 모델
·2026.04.16 11:31
핵심 내용
Gemma 4 26B를 MLX 4-bit로 최적화한 빠른 비검열 로컬 모델.
자세히 보기
Gemma 4 26B IT를 기반으로 한 애플 실리콘 MLX 최적화 4-bit 양자화 텍스트 전용 모델이다. 용량은 약 13GB다.
원본보다 더 똑똑하고, 같은 머신에서 더 빠르게 동작하며, 코드 생성·도구 사용·한국어 프롬프트에서 안정적인 출력을 목표로 한다.
주요 수치도 함께 제시된다.
- 퀵벤치 95.8점으로 원본 91.4점보다 향상
- 생성 속도 46.2 tok/s, 약 8.7% 빠름
- 코드 생성 98.6점으로 원본 대비 +6.3
- 한국어 프롬프트 95.0점으로 원본 대비 +4.3
특히 uncensored 특성을 유지하면서도 출력이 흔들리지 않는 점을 강조한다. 콘텐츠 필터에 막히는 답변이 없고, 코드 생성과 에이전트 스타일 프롬프트에서도 더 안정적이라고 설명한다.
로컬 에이전트 워크로드에도 바로 투입할 수 있다고 소개한다.
- 브라우저 자동화
- 도구 호출
- 계획 수립
- 로컬 파이프라인용 텍스트 처리
실행 예시는 다음과 같다.
mlx_lm.server --model Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2 --port 8080
OpenAI 호환 서빙을 자동 지원하며, 별도 템플릿 설정은 필요 없다고 한다. 오히려 --chat-template에 경로를 넣으면 응답이 손상될 수 있다고 경고한다.
포맷은 MLX 4-bit, BF16·U32 텐서, Safetensors다.
댓글에서는 원본 Gemma 4와 라이선스가 다르다는 지적이 있었고, Apache 2.0이 아니라는 언급도 있었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.