AI Briefing

Apple Silicon 기반 LLM 추론 성능 분석

Anubis-OSS leaderboard analysis has been updated. 371 submitted runs, 10 Apple chips, 218 models

·2026.05.05 22:43

Apple Silicon 칩셋별 LLM 추론 성능, 전력 효율 및 MoE 모델 구동 성능에 대한 벤치마크 분석 결과가 공개되었다.

메모리 대역폭과 추론 속도: M1 Ultra(800 GB/s)는 대형 모델에서 36.5 tok/s를 기록한 반면, M4 Pro(273 GB/s)는 45.9 tok/s를 기록했다. M3 Max(400 GB/s)는 155 tok/s의 중간값을 보여주며, 대역폭과 메모리 용량의 결합이 성능의 핵심임을 입증했다.

전력 효율성: M4는 0.34 W/tok으로 가장 효율적인 칩으로 나타났다. A18 Pro는 0.19 W/tok으로 효율은 가장 높았으나, 8GB RAM 제한으로 인해 처리량이 낮았다.

MoE(Mixture-of-Experts) 모델의 접근성: 128GB 메모리 환경에서 GPT-OSS-120B(74.3 tok/s)와 Qwen3.5-122B(59.5 tok/s) 등 대규모 MoE 모델이 원활하게 구동됨을 확인했다. 이는 고용량 RAM을 탑재한 Mac 라인업에서 대형 모델 활용 가능성이 높음을 시사한다.

주요 칩 성능 특이사항:

  • M5 Max: 데이터셋 내 최고 평균 속도인 173 tok/s를 기록하며 강력한 성능을 입증했다.
  • A18 Pro: Llama-3.2-3B 모델에서 18,600 tok/s라는 압도적인 Prefill(입력 처리) 속도를 기록하며 에지 디바이스로서의 강점을 보였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.