Apple Silicon, ANE+GPU 병렬 Prefill 구현
Someone apparently cracked dual ANE+GPU prefill on apple silicon
·2026.08.20 06:56
핵심 내용
Apple Silicon에서 ANE와 GPU를 병렬로 활용해 LLM Prefill 속도를 최대 50%까지 향상시키는 기술이 공개되었습니다.
자세히 보기
Apple Silicon 환경에서 **ANE(Neural Engine)**와 GPU를 동시에 활용하여 LLM의 Prefill 속도를 높이는 기술이 omlx 프로젝트에 적용되었습니다.
기존에는 동기화 문제로 인해 ANE 활용 시 성능 저하가 있었으나, MLP와 GDN의 일부만 샤딩하는 방식으로 최적화하여 Qwen3.8 27B q4 모델에서 M3 Ultra 기준 약 **50%**의 Prefill 속도 향상을 달성했습니다.
- M1 Pro (32GB) 환경에서도 9B 모델 기준 280 -> 334 토큰/초로 약 **19%**의 성능 개선이 확인되었습니다.
- 해당 기능은 커스텀 커널(
OMLX_WITH_CUSTOM_KERNEL=1)이 필요하며, 피크 메모리 사용량이 약 2배로 증가하는 점을 유의해야 합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.