AI Briefing

16GB M3 Qwen35B 8.9TPS

Running Qwen 35BA3B on a 16GB M3 Macbook Air at 8.9TPS!

·2026.05.01 18:36

16GB M3 MacBook Air에서 `mmap`으로 Qwen 35B-A3B를 8.9 TPS로 구동했다.

15인치 16GB M3 MacBook Air에서 unsloth/Qwen3.5-35B-A3B-GGUFQwen3.5-35B-A3B-UD-IQ3_XXS.gguf를 내려받아 llama-server로 실행했다.

핵심은 **--mmap**이었다. 이 옵션이 구동의 핵심이라고 설명했다.

주요 실행 설정은 다음과 같다.

  • --ctx-size 4096
  • --n-gpu-layers 0
  • --parallel 1
  • --flash-attn on
  • --threads 6
  • --batch-size 512
  • --ubatch-size 128
  • --cache-type-k q4_0
  • --cache-type-v q4_0
  • --no-warmup

실측 처리량은 8.9 TPS였다. cache-type-k/v q4_0는 필수는 아니지만 메모리 사용량을 줄이기 위한 선택이라고 덧붙였다.

실행 후에는 http://127.0.0.1:8081/v1/ API와 http://127.0.0.1:8081 llama.cpp WebUI를 사용할 수 있다고 안내했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.