EschaLabs, 2-bit Qwen3.6-35B-A3B 양자화 모델 공개
2-bit Qwen3.6-35B-A3B with ~100% FP8 quality retention
·2026.07.30 06:25
FP8 수준의 성능을 유지하면서 용량을 획기적으로 줄인 2-bit Qwen3.6-35B-A3B 모델과 전용 런타임이 공개되었습니다.
EschaLabs가 소비자용 GPU 환경에서 실용성을 높이기 위해 개발한 2-bit Qwen3.6-35B-A3B 양자화 모델을 공개했습니다. 이 모델은 모델 인식 미세 조정(Model-aware fine-tuning)과 복구 과정을 결합하여 저비트 양자화 시 발생하는 성능 저하를 최소화했습니다.
주요 특징 및 성능:
- 효율성: 디스크 용량 12.3GB, RTX 4090 기준 초당 225 토큰 추론 속도 구현.
- 하드웨어 요구사항: 24GB 소비자용 GPU 1장(또는 컨텍스트 축소 시 16GB)에서 구동 가능.
- 성능 유지: MMLU-Pro(80.9), MATH-500(93.8) 등 주요 벤치마크에서 FP8 베이스라인과 유사하거나 상회하는 성능을 기록.
기술적 세부사항:
- 표준 GPTQ나 AWQ 방식이 아닌, 전용 커스텀 런타임이 필요한 파이프라인을 사용합니다.
- SGLang 엔진을 지원하여 OpenAI 호환 API, 동시성, 도구 호출(Tool calling) 및 구조화된 출력을 제공합니다.
- Python 환경 없이 실행 가능한 ZML 런타임도 함께 제공되며, 향후 MLX, vLLM, GGUF 지원을 계획 중입니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.