Qwen3.8-27B SOTA GGUF 공개
[Release] SOTA GGUFs for Qwen3.8-27B: GSQ-RCO at 2.5 to 3.0 bpw
·2026.08.29 06:46
핵심 내용
IST-DASLab이 GSQ와 RCO 기술을 적용해 기존 대비 성능을 크게 개선한 Qwen3.8-27B GGUF 모델을 공개했다.
자세히 보기
IST-DASLab이 새로운 양자화 기술인 GSQ(Gumbel-Softmax Quantization)와 RCO(Riemannian Constrained Optimization)를 적용한 Qwen3.8-27B GGUF 모델을 공개했다. 이 모델들은 llama.cpp, Ollama, LM Studio 등 주요 추론 엔진에서 수정 없이 실행 가능하다.
핵심 기술 및 성능
- GSQ: 2~3비트 구간에서 스칼라-벡터 간 성능 격차를 줄이는 학습형 스칼라 양자화 기법이다.
- RCO: 텐서별 중요도에 따라 양자화 유형을 할당하여 용량 제한 내에서 작업 손실을 최소화한다.
벤치마크 결과
- 3.00 bpw (10.1 GB): AIME25에서 원본 BF16 모델과 동일한 성능(100.00)을 기록했으며, GPQA-Diamond와 LiveCodeBench v6에서도 원본 모델과 1점 이내의 근사치를 보였다.
- 2.75 bpw (9.3 GB): AIME25 점수 100.00을 달성했으며, 제로샷 평균 점수(75.70)가 BF16 원본 모델(74.34)을 상회했다.
- 비교 우위: 약 8.4 GB 크기의 Unsloth Dynamic(IQ2_S) 대비 AIME25에서 +10.0점, GPQA-Diamond에서 +8.6점, LiveCodeBench에서 +4.6점의 성능 향상을 보였다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.