ISTA-DASLab, GSQ-RCO 양자화 Qwen3.8-Flash-Next GGUF 출시
[Release] GSQ-RCO GGUFs for Qwen3.8-Flash-Next, plus a 50% expert-pruned Coder build at ~1.89 bpw
·2026.09.29 17:40
핵심 내용
ISTA-DASLab이 3.50 bpw에서 BF16급 성능을 내는 Qwen3.8-Flash-Next 양자화 모델을 공개했다.
자세히 보기
ISTA-DASLab이 Qwen3.8-Flash-Next의 GSQ-RCO 양자화 GGUF를 공개했다. 이 모델은 176.9B 파라미터를 가진 희소 혼합 전문가(MoE) 모델이다. 이번 릴리스에는 2.40~3.50 bpw 범위의 표준 양자화 변형 4종과 라우팅된 전문가의 절반을 제거한 특수 Coder 빌드가 포함된다.
양자화 기술
이번 릴리스는 두 가지 주요 최적화 기법을 사용한다:
- GSQ (Gumbel-Softmax Quantization): 낮은 비트 폭에서 스칼라와 벡터 양자화 간 격차를 줄이기 위해 그리드 할당과 그룹 스케일을 학습하는 사후 학습 스칼라 양자화 방법이다.
- RCO (Riemannian Constrained Optimization): 작업 손실에 대한 경사 하강법을 통해 정확한 메모리 예산을 강제하며, 양자화 유형 할당 및 유지할 전문가 선택에 사용된다.
성능 지표
IQ3_S 변형(3.50 bpw, 83.6 GB)은 주요 벤치마크에서 BF16 기본 모델과 동등하거나 이를 상회한다:
- AIME25: 100.00
- GPQA-Diamond: 92.93 (BF16은 91.92)
- LiveCodeBench v6: 86.86 (BF16은 87.43)
- 작업 평균: 93.26 (BF16은 93.12)
Q2_0 변형(2.40 bpw, 66.4 GB)은 78.00의 영점 평균을 기록하며, 크기는 약 1/5 수준이지만 BF16 값인 76.94를 초과한다.
전문가 제거 Coder 빌드
Coder 빌드는 RCO가 KL 발산을 최적화하여 선택한 레이어당 512개 중 256개의 라우팅된 전문가를 제거한다. 유지된 가중치는 3.5 bpw를 유지한다.
- 실효 비트 폭: 제거와 양자화를 결합하면 원본 트랜스포머 파라미터당 평균 1.89 비트가 된다.
- 메모리 사용량: 총 파일 크기는 58.4 GB이지만, 상주 작업 세트는 29.6 GB에 불과해 단일 32 GB 가속기에서 실행할 수 있다.
- 기능 유지: SWE-bench Verified 점수는 75.60(BF16의 91.3%)이고, LiveCodeBench v6는 86.28(BF16의 98.7%)이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.