AI Briefing

M5pro가 122B 돌렸다

Qwen 3.5 122B on M5pro 64gb

·2026.04.14 03:56

M5pro 64GB에서 Qwen 3.5 122B가 IQ2-m 기준으로 꽤 잘 돌아갔다.

M5pro 64GB에서 Qwen 3.5 122B를 돌려본 결과, IQ2-m은 꽤 잘 동작했고 IQ3-xxs는 메모리 한계에 가까웠다.

  • IQ3-xxs 기준 전체 로드 메모리: 50.83GB
  • 모델 자체 사용량: 44.76GB
  • 32k ctx에서 전체 시스템 RAM 사용량: 59.07GB / 64GB
  • GPU 오프로드: 48/48
  • 46/48로 낮춰도 체감 차이는 거의 없고 토큰 속도만 약 2 tok/s 감소
  • 출력 속도: 시작 시 36 tok/s, 32k ctx 도달 시 28 tok/s
  • 첫 토큰 생성 시간: 전 구간 6~8초

대용량 모델이라도 충분한 통합 메모리가 있는 M5pro 64GB 환경에서는 로컬 구동이 가능했고, 특히 IQ2-m이 실사용 가능성 측면에서 유의미하게 보인다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.