AI Briefing

16GB M3 Qwen35B 8.9TPS

Running Qwen 35BA3B on a 16GB M3 Macbook Air at 8.9TPS!

·2026.05.01 18:36

핵심 내용

16GB M3 MacBook Air에서 `mmap`으로 Qwen 35B-A3B를 8.9 TPS로 구동했다.

자세히 보기

15인치 16GB M3 MacBook Air에서 unsloth/Qwen3.5-35B-A3B-GGUF의 Qwen3.5-35B-A3B-UD-IQ3_XXS.gguf를 내려받아 llama-server로 실행했다.

핵심은 **--mmap**이었다. 이 옵션이 구동의 핵심이라고 설명했다.

주요 실행 설정은 다음과 같다.

  • --ctx-size 4096
  • --n-gpu-layers 0
  • --parallel 1
  • --flash-attn on
  • --threads 6
  • --batch-size 512
  • --ubatch-size 128
  • --cache-type-k q4_0
  • --cache-type-v q4_0
  • --no-warmup

실측 처리량은 8.9 TPS였다. cache-type-k/v q4_0는 필수는 아니지만 메모리 사용량을 줄이기 위한 선택이라고 덧붙였다.

실행 후에는 http://127.0.0.1:8081/v1/ API와 http://127.0.0.1:8081 llama.cpp WebUI를 사용할 수 있다고 안내했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.