Qwen3.8-27B NVFP4 양자화 공개
Fully quantized NVFP4 Qwen3.8-27B with QUASAR QAD
·2026.08.26 10:04
핵심 내용
QUASAR QAT 알고리즘을 적용해 Qwen3.8-27B를 NVFP4로 양자화하여 BF16급 성능을 유지하는 체크포인트를 공개했다.
자세히 보기
새로운 QAT(양자화 인식 학습) 알고리즘인 QUASAR를 사용하여 Qwen3.8-27B 모델을 **NVFP4(W4A4)**로 완전 양자화한 체크포인트가 공개되었습니다. 기존 BF16 모델을 교사로 하여 2,446스텝의 양자화 인식 증류(QAD) 과정을 거쳤으며, NVIDIA Blackwell GPU에서 vLLM으로 추론이 가능합니다.
일반적으로 어텐션 및 GDN 레이어는 품질 저하를 우려해 높은 정밀도로 유지하지만, QUASAR를 적용한 이 모델은 BF16과 거의 동일한 성능을 유지합니다. 모델 크기는 19.7GB로, 기존 BF16(55.6GB) 대비 3분의 1 수준이며, 다른 NVFP4 양자화 모델들보다 더 작은 용량으로 더 높은 정확도를 기록했습니다.
성능 비교 (GPQA-Diamond / AIME26):
- Qwen3.8-27B (BF16): 0.9141 / 1.0000
- QUASAR NVFP4: 0.9091 / 1.0000
- unsloth NVFP4: 0.8939 / 0.9778
- Inferact NVFP4: 0.8763 / 0.9667
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.