AI Briefing

Qwen3.8-27B NVFP4 양자화 공개

Fully quantized NVFP4 Qwen3.8-27B with QUASAR QAD

·2026.08.26 10:04

핵심 내용

QUASAR QAT 알고리즘을 적용해 Qwen3.8-27B를 NVFP4로 양자화하여 BF16급 성능을 유지하는 체크포인트를 공개했다.

자세히 보기

새로운 QAT(양자화 인식 학습) 알고리즘인 QUASAR를 사용하여 Qwen3.8-27B 모델을 **NVFP4(W4A4)**로 완전 양자화한 체크포인트가 공개되었습니다. 기존 BF16 모델을 교사로 하여 2,446스텝의 양자화 인식 증류(QAD) 과정을 거쳤으며, NVIDIA Blackwell GPU에서 vLLM으로 추론이 가능합니다.

일반적으로 어텐션 및 GDN 레이어는 품질 저하를 우려해 높은 정밀도로 유지하지만, QUASAR를 적용한 이 모델은 BF16과 거의 동일한 성능을 유지합니다. 모델 크기는 19.7GB로, 기존 BF16(55.6GB) 대비 3분의 1 수준이며, 다른 NVFP4 양자화 모델들보다 더 작은 용량으로 더 높은 정확도를 기록했습니다.

성능 비교 (GPQA-Diamond / AIME26):

  • Qwen3.8-27B (BF16): 0.9141 / 1.0000
  • QUASAR NVFP4: 0.9091 / 1.0000
  • unsloth NVFP4: 0.8939 / 0.9778
  • Inferact NVFP4: 0.8763 / 0.9667

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.