Gemma 4 돌파
Gemma 4:26b on OC using LM Studio and Docker
·2026.04.16 03:20
핵심 내용
Mac Studio M4 Max에서 Gemma 4:26B를 OC+LM Studio로 돌려 40 tok/s를 확보했다.
자세히 보기
Mac Studio **M4 Max(36GB RAM, 512GB SSD)**에서 Gemma 4:26B를 돌리기 위해 여러 설정을 조정한 끝에, LM Studio와 별도 OpenClaude(OC) 인스턴스 조합으로 동작시키는 데 성공했다.
핵심은 Docker Desktop을 설치해 OC를 sandbox 컨테이너 안에서 실행하는 구성이었고, 체감상 지연이나 속도 저하가 없었다.
성능은 약 40 tokens/s 수준이었으며, 컨텍스트는 64k까지는 시험 중이지만 262k로 올리면 오류가 발생했다.
추가로 적용한 설정은 다음과 같다.
- K/V cache quantization: Q4_0
- 모델을 메모리에 유지하는 옵션 활성화
작성자는 이 구성이 Qwen 3.5나 GLM 4.7 Flash급 모델과 비교해 얼마나 강한지 계속 시험해볼 계획이라고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.