추천
NVIDIA, Qwen3.6 NVFP4 공개
nvidia/Qwen3.6-35B-A3B-NVFP4 · Hugging Face
·2026.05.31 02:49
핵심 내용
NVIDIA가 Alibaba의 Qwen3.6-35B 모델을 NVFP4 데이터 타입으로 양자화하여 공개했다.
자세히 보기
NVIDIA가 Alibaba의 Qwen3.6-35B-A3B 모델을 NVFP4 데이터 타입으로 양자화한 버전을 공개했다.
이 모델은 NVIDIA Model Optimizer를 사용한 사후 양자화(Post Training Quantization) 방식을 적용했으며, vLLM을 통한 추론에 최적화되어 있다.
주요 특징:
- 메모리 절감: 파라미터당 비트 수를 16비트에서 4비트로 줄여, 디스크 및 GPU 메모리 요구량을 약 3.06배 감소시켰다.
- 양자화 범위: MoE(Mixture of Experts) 구조 내 트랜스포머 블록의 선형 연산자(linear operators) 가중치와 활성화 함수에 양자화를 적용했다.
- 성능 유지: MMLU Pro(85.0), GPQA Diamond(94.7) 등 주요 벤치마크에서 BF16 대비 매우 미미한 성능 저하를 보이며 높은 정확도를 유지했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.