AI Briefing

16GB M4, Qwen 35B SSD 병목

Qwen 35B-A3B as an always-on agentic loop on a 16GB Mac M4: disk became the bottleneck before RAM

·2026.04.28 18:36

16GB Mac M4에서 Qwen 35B-A3B 상시 구동은 SSD가 먼저 병목이 됐다.

Qwen 3.5 35B-A3B UD-IQ3_XXS(디스크 12GB)를 16GB unified memoryM4 Mac mini에서 llama.cpp--mmap, --flash-attn으로 돌리자 배치 작업은 실제로 돌아갔다.

  • MoE expert paging으로 RAM 점유: 4~6GB
  • 디코드 속도: 약 17 tok/s
  • 실행 조건: --threads 8, --ctx-size 4096

같은 모델을 always-on agentic loop로 확장해 Ollama, llama-server, LiteLLM, Claude Code, Codex CLI를 함께 돌리자 병목은 RAM이 아니라 SSD로 이동했다.

지속적인 mmap paging에 Claude Code의 파일 워처와 인덱서, Codex의 컨텍스트 유지가 겹치면서 SSD contention이 커졌고, Mac은 원인 로그가 남지 않은 채 재부팅되기 시작했다. cron 작업도 5분 이상 지연되거나 실패했다. claude-code 저장소의 메모리 증가, idle CPU pegging, 프로세스 누적 관련 open issue도 함께 언급됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.