3090용 27B 최적화
Qwen3.6-27B-GPTQ-Pro-4Bit optimized for the Ampere GPU crowd
·2026.04.23 09:20
Qwen3.6-27B를 Ampere GPU에서 돌리기 위한 4bit GPTQ-Pro 양자화 모델이 공개됐다.
Qwen3.6-27B를 4-bit GPTQ-Pro로 양자화해 소비자용 Ampere GPU에서도 현실적으로 돌릴 수 있게 만들었다.
대상은 RTX 3090, 3080, A5000, A6000 같은 카드이며, 목표는 데이터센터급 장비 없이도 27B 추론·코딩 모델을 로컬에서 빠르게 서빙하는 것이다.
핵심 포인트는 다음과 같다.
- GPTQ-Pro + FOEM 양자화로 품질 손실을 줄임
- Marlin 최적화로 고처리량 추론 지원
- 2× RTX 3090에서 테스트
- 생성 속도 약 64 tok/s
- 첫 토큰 응답 시간 약 54 ms TTFT
- vLLM으로 대형 컨텍스트 지원
- Apache 2.0 라이선스
시작 예시는 vllm serve에 gptq_marlin, tensor-parallel-size 2, max-model-len 132144 등을 넣는 구성이다.
모델 링크는 groxaxo/Qwen3.6-27B-GPTQ-Pro-4Bit, 프로젝트는 GPTQ-Pro다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.