AI Briefing

MLX용 W8A8 양자화 SDK 'Cider' 공개

We added W8A8 activation quantization to MLX — prefill went from 2.84s to 2.52s on M5 Pro

·2026.05.25 17:16

MLX의 한계를 보완하여 Apple Silicon에서 W8A8 활성화 양자화를 지원하는 SDK 'Cider'가 공개되었다.

Mininglamp AI가 MLX 프레임워크의 한계를 극복하기 위해 개발한 Cider SDK를 공개했다. 기존 MLX는 가중치(Weight)만 양자화하고 활성화(Activation)는 FP16을 유지했으나, Cider는 W8A8(8-bit Weight, 8-bit Activation) 양자화를 지원한다.

M5 Pro 환경에서 4,516 토큰 컨텍스트를 기준으로 테스트한 결과, Prefill 속도가 2.84초에서 2.52초로 약 11% 향상되었으며, Decode 속도는 약 80 tok/s로 안정적으로 유지되었다.

이 SDK는 커스텀 Metal 커널을 MLX 프리미티브로 등록하여 작동하며, M5 이상의 칩에서 INT8 TensorOps를 활용해 최적의 성능을 제공한다. (M4 이하 기기에서는 기존 경로로 자동 폴백됨)

정확도 측면에서도 Qwen3-8B 및 Llama3-8B 모델에 대해 FP16 대비 매우 낮은 Perplexity(PPL) 증가율을 보여, 성능과 정밀도 사이의 효율적인 균형을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.