Apple Silicon 전용 추론 엔진 'Lily', MLX-LM 대비 디코딩 속도 35% 향상
·2026.09.02 09:00
핵심 내용
Apple Silicon 특화 추론 엔진 Lily가 MLX-LM 대비 디코딩 속도 35% 향상과 높은 하드웨어 활용률을 달성했다.
1 / 4
자세히 보기
Apple Silicon 아키텍처에 최적화된 경량 추론 엔진 Lily가 MLX-LM 대비 성능을 크게 개선했다. M5 Max(40-core GPU, 128GB RAM) 환경에서 Qwen3.6-35B-A3B 모델을 실행한 결과, Prefill 속도는 평균 1.23배, Decode 속도는 평균 1.35배(35%) 향상되었다.
Lily는 MoE 라우팅과 Gated DeltaNet 구조를 가진 Qwen3.6-35B-A3B 모델에 맞춰 다음과 같은 최적화를 적용했다.
- Prefill 최적화: 4-bit 가중치의 역양자화를 Grouped GEMM 내부에서 수행해 중간 배열의 메모리 쓰기·읽기를 제거했다. 이를 별도 역양자화 연산을 사용하는 구성과 비교한 실험에서 512-token 프롬프트의 엔드투엔드 prefill 처리량이 77.4% 개선되었다. 전문가 라우팅을 GPU에 유지해 CPU 동기화를 제거하는 최적화도 별도로 적용했다.
- Decode 최적화: 'GPU Token Handoff' 기법을 통해 배치 1 환경에서 CPU-GPU 간 데이터 왕복을 최소화했다. 또한 긴 컨텍스트(32K 이상)에서는 고정 블록 레이아웃으로 전환하여 128K 컨텍스트에서 엔드투엔드 디코딩 속도를 40.2% 향상시켰다.
성능 분석 결과, MoE GEMM은 해당 접근 패턴에서 측정한 최대 지속 가중치 읽기 속도의 97.9%에 도달했다. 가중치 읽기가 여전히 제한 요인이어서 추가 최적화 여지는 작았다. 다만, Speculative Decoding은 비효율적인 연산 형태와 전문가 가중치 읽기 증가로 인해 오히려 속도를 18% 저하시켜 적용되지 않았다. Lily는 측정한 모든 길이에서 MLX-LM보다 우월한 처리량을 기록했으며, 수치적 일관성(Perplexity 차이 0.04%)도 유지했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.