AI Briefing

oQ·Q·MXFP·UD KLD 비교

KLD comparison of oQ, Q, MXFP and UD MLX quantizations

·2026.04.30 05:37

Qwen3.6-35B-A3B에서 oQ, Q, MXFP, UD MLX의 KLD와 메모리를 비교했다.

Qwen3.6-35B-A3B를 대상으로 mlx-vlm v0.4.4에서 측정했다.

  • 설정: bfloat16 모델에 16,384토큰 단일 프롬프트를 넣고, Aes Sedai의 combined_all_micro.txt를 사용했다.
  • oQ: oQ20.277344 nats / 11.40 GiB, oQ40.028076 / 18.83 GiB, oQ60.008057 / 26.51 GiB, oQ80.005219 / 34.27 GiB였다.
  • Q·MXFP: Q23.093750 / 10.10 GiB로 크게 무너졌고, Q40.062500 / 18.17 GiB, Q60.009094 / 26.23 GiB, Q80.005402 / 34.30 GiB였다. MXFP40.111328 / 17.16 GiB, MXFP80.041992 / 33.29 GiB였다.
  • UD MLX: 3-bit0.048584 / 15.35 GiB, 4-bit0.016357 / 19.32 GiB였다.

수치상 oQ4Q4MXFP4보다 KLD가 낮고, oQ6·oQ8Q6·Q8에 거의 근접한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.