추천NVIDIA, Qwen3.6 NVFP4 공개
nvidia/Qwen3.6-35B-A3B-NVFP4 · Hugging Face
·2026.05.31 02:49
NVIDIA가 Alibaba의 Qwen3.6-35B 모델을 NVFP4 데이터 타입으로 양자화하여 공개했다.
NVIDIA가 Alibaba의 Qwen3.6-35B-A3B 모델을 NVFP4 데이터 타입으로 양자화한 버전을 공개했다.
이 모델은 NVIDIA Model Optimizer를 사용한 사후 양자화(Post Training Quantization) 방식을 적용했으며, vLLM을 통한 추론에 최적화되어 있다.
주요 특징:
- 메모리 절감: 파라미터당 비트 수를 16비트에서 4비트로 줄여, 디스크 및 GPU 메모리 요구량을 약 3.06배 감소시켰다.
- 양자화 범위: MoE(Mixture of Experts) 구조 내 트랜스포머 블록의 선형 연산자(linear operators) 가중치와 활성화 함수에 양자화를 적용했다.
- 성능 유지: MMLU Pro(85.0), GPQA Diamond(94.7) 등 주요 벤치마크에서 BF16 대비 매우 미미한 성능 저하를 보이며 높은 정확도를 유지했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.