AI Briefing

oQ·Q·MXFP·UD KLD 비교

KLD comparison of oQ, Q, MXFP and UD MLX quantizations

·2026.04.30 05:37

핵심 내용

Qwen3.6-35B-A3B에서 oQ, Q, MXFP, UD MLX의 KLD와 메모리를 비교했다.

자세히 보기

Qwen3.6-35B-A3B를 대상으로 mlx-vlm v0.4.4에서 측정했다.

  • 설정: bfloat16 모델에 16,384토큰 단일 프롬프트를 넣고, Aes Sedai의 combined_all_micro.txt를 사용했다.
  • oQ: oQ2는 0.277344 nats / 11.40 GiB, oQ4는 0.028076 / 18.83 GiB, oQ6는 0.008057 / 26.51 GiB, oQ8는 0.005219 / 34.27 GiB였다.
  • Q·MXFP: Q2는 3.093750 / 10.10 GiB로 크게 무너졌고, Q4는 0.062500 / 18.17 GiB, Q6는 0.009094 / 26.23 GiB, Q8는 0.005402 / 34.30 GiB였다. MXFP4는 0.111328 / 17.16 GiB, MXFP8는 0.041992 / 33.29 GiB였다.
  • UD MLX: 3-bit는 0.048584 / 15.35 GiB, 4-bit는 0.016357 / 19.32 GiB였다.

수치상 oQ4는 Q4와 MXFP4보다 KLD가 낮고, oQ6·oQ8은 Q6·Q8에 거의 근접한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.