AI Briefing

Qwen3.5 모델 quantization, 왜 커뮤니티 버전은 성능이 떨어지나

·2026.04.18 21:35

핵심 내용

균일 quantization이 Qwen3.5의 민감한 레이어를 망가뜨린다.

자세히 보기

Unsloth가 150개 이상의 benchmark와 121개 설정 비교를 통해, 커뮤니티가 배포한 Qwen3.5 MLX 양자화 모델의 성능 저하 원인을 분석했다.

핵심 문제는 대부분의 커뮤니티 도구가 모든 layer에 같은 bit 수를 적용하는 uniform quantization을 쓴다는 점이다. Qwen3.5는 일반적인 self-attention과 GatedDeltaNet 기반 linear attention이 번갈아 나오는 hybrid 구조인데, 이 구조에서는 특정 layer의 정보 손실 민감도가 매우 다르게 나타난다.

특히 linear_attn.out_proj 레이어가 4-bit 압축에서 매우 취약했다. 이 레이어의 정보 손실 민감도는 lm_head 대비 약 120배 높게 측정됐고, 그 결과 tool calling 오류, 의미 없는 출력, hallucination이 발생했다.

Unsloth의 해법은 레이어별로 bit 수를 다르게 주는 mixed-bit quantization이다.

  • 민감도가 낮은 MLP 레이어는 3-bit
  • attention Q/K/V 레이어는 5-bit + AWQ 적용
  • 가장 민감한 output layer는 bf16 유지

보정(calibration) 데이터도 중요했다. 위키피디아 같은 일반 텍스트 대신 대화, 코딩, tool-call 예제를 사용해야 실제 사용 환경에 맞는 중요도 계산이 가능했다.

효과는 분명하다. tool calling, structured output, code generation 품질이 기존 커뮤니티 버전보다 크게 좋아졌고, MLX에서도 동일한 GGUF 버전 수준의 성능을 구현했다. 다만 일부 민감한 레이어를 bf16으로 남겨야 해서, 순수 저비트 모델보다 디스크 용량은 더 크다.

요지는 단순히 bit 수를 줄이는 것이 아니라, 모델 내부 구조와 레이어 민감도를 이해해 압축해야 한다는 점이다. 실무에서 경량화 모델을 쓸 때는 배포자의 quantization 방식과 calibration 데이터를 반드시 확인해야 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.