MLX Q·oQ 비교
I have compared MLX Q and oQ by their KL divergence and RAM usage
·2026.04.25 03:24
MLX Q와 oQ의 양자화 단계를 KL divergence와 RAM으로 비교했다.
MLX Q와 oQ 양자화를 **KL divergence(KLD)**와 RAM 사용량 기준으로 비교했다.
- oQ는 저비트 구간에서 Q 대비 더 낮은 KLD를 보였다.
- 예를 들어 oQ4는 KLD 0.116943, RAM 22.70GiB였고, Q4는 KLD 0.211914, RAM 21.96GiB였다.
- Q2는 KLD 4.687500, RAM 13.89GiB로 압축은 더 강했지만 분포 손실이 컸다.
- 고비트 구간에서는 두 방식의 차이가 줄었고, **Q8(0.011803, 38.09GiB)**와 **oQ8(0.009682, 38.08GiB)**는 거의 비슷했다.
재현용 스크립트와 차트는 mlx-kld 저장소에 공개돼 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.