AI Briefing

Apple Silicon, ANE+GPU 병렬 Prefill 구현

Someone apparently cracked dual ANE+GPU prefill on apple silicon

·2026.08.20 06:56

핵심 내용

Apple Silicon에서 ANE와 GPU를 병렬로 활용해 LLM Prefill 속도를 최대 50%까지 향상시키는 기술이 공개되었습니다.

자세히 보기

Apple Silicon 환경에서 **ANE(Neural Engine)**와 GPU를 동시에 활용하여 LLM의 Prefill 속도를 높이는 기술이 omlx 프로젝트에 적용되었습니다.

기존에는 동기화 문제로 인해 ANE 활용 시 성능 저하가 있었으나, MLP와 GDN의 일부만 샤딩하는 방식으로 최적화하여 Qwen3.8 27B q4 모델에서 M3 Ultra 기준 약 **50%**의 Prefill 속도 향상을 달성했습니다.

  • M1 Pro (32GB) 환경에서도 9B 모델 기준 280 -> 334 토큰/초로 약 **19%**의 성능 개선이 확인되었습니다.
  • 해당 기능은 커스텀 커널(OMLX_WITH_CUSTOM_KERNEL=1)이 필요하며, 피크 메모리 사용량이 약 2배로 증가하는 점을 유의해야 합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.