iPhone별 Gemma 4 E2B 설정 보고
I ran Gemma 4 E2B with llama.cpp on a lot of different iPhones, here's the setup report
·2026.04.28 21:24
iOS의 llama.cpp에서 Gemma 4 E2B 멀티모달 OOM을 해결했다.
20여 대의 iPhone에서 llama.cpp로 Gemma 4 E2B-it-Q3_K_S.gguf를 돌리며, App Store 배포 빌드에서만 터지던 멀티모달 OOM 원인을 추적했다.
개발용 디바이스에서는 정상 동작했지만, 프로덕션 빌드에서는 GPU on/off, 더 작은 quant, image token budget 축소로도 해결되지 않았다.
아래 entitlements를 추가하자 6GB+ RAM 기기(iPhone 13 Pro 이상)에서 크래시가 사라졌다.
com.apple.developer.kernel.increased-memory-limitcom.apple.developer.kernel.extended-virtual-addressing
4GB RAM 기기(iPhone 13 mini, 11 Pro)에서는 여전히 OOM이 남았고, n_ctx=1024, n_batch=256, image_tokens=70, n_gpu_layers=99 설정으로 멀티모달 생성 속도 0.2 tok/s를 확보했다고 밝혔다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.