AI Briefing

Apple Silicon LLM 추론 성능 분석 결과

Anubis-OSS leaderboard analysis has been updated. 371 submitted runs, 10 Apple chips, 218 models

·2026.05.05 22:42

Apple M4/M5 및 A18 Pro 칩의 LLM 추론 성능과 전력 효율성 분석 결과가 공개되었습니다.

메모리 대역폭이 LLM 추론 성능의 핵심 동력임이 확인되었습니다. M1 Ultra(800 GB/s)와 M3 Max(400 GB/s)는 높은 대역폭을 바탕으로 우수한 성능을 보였습니다.

M4 시리즈는 뛰어난 전력 효율을 기록했습니다. 특히 기본 M4 칩은 토큰당 0.34W를 기록하며 M4 Pro나 Max 대비 훨씬 높은 효율성을 보여주었습니다.

대규모 MoE 모델의 접근성이 높아졌습니다. 128GB RAM을 갖춘 M4 Max 및 M5 Max 기기에서는 GPT-OSS-120B, Qwen3.5-122B와 같은 120B+ 파라미터 모델을 안정적인 속도로 구동할 수 있습니다.

칩별 주요 특이점은 다음과 같습니다:

  • M5 Max: 데이터셋 내에서 가장 높은 평균 토큰 생성 속도를 기록하며 강력한 성능을 입증했습니다.
  • A18 Pro: Llama-3.2-3B 모델 테스트 시 18,600 tok/s라는 압도적인 프리필(Prefill) 속도를 기록하여 에지 디바이스로서의 강점을 보였습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.