Apple Silicon macOS VM에서 llama.cpp LLM 추론 11~16배 가속
·2026.08.12 05:33
핵심 내용
Apple Silicon macOS VM에서 Metal 호환성 계층으로 llama.cpp 추론 속도를 최대 16배 높였다.
자세히 보기
Lume의 macOS VM은 Apple의 Virtualization.framework를 통해 호스트 Apple GPU 기반의 가상 GPU를 사용한다. 그러나 기본 Tahoe VM은 보수적인 Metal 기능 프로파일을 보고해 llama.cpp가 느린 GPU 코드 경로를 선택하는 문제가 있었다.
이를 해결하기 위해 프로세스 단위 호환성 계층을 구축했다. 이 계층은 게스트 운영체제의 특정 Metal 기능 응답을 조정해 llama.cpp가 최신 Metal 커널을 선택하도록 유도한다.
벤치마크에서는 다음과 같은 성능 향상이 관찰됐다.
- 전체 LLM 추론 성능: 11~16배 향상
- 프롬프트 처리: 최대 7.2배 향상
- 토큰 생성: 최대 14.5배 향상
이 방식은 VM 전체가 아닌 특정 게스트 프로세스에만 적용된다. 개발팀은 Apple Silicon 칩과 macOS 버전, Metal 워크로드별 효과를 검증할 수 있도록 해당 기술을 Lume·Cua와 동일한 permissive license의 연구 릴리스로 공개했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.