AI Briefing

3090용 27B 최적화

Qwen3.6-27B-GPTQ-Pro-4Bit optimized for the Ampere GPU crowd

·2026.04.23 09:20

Qwen3.6-27B를 Ampere GPU에서 돌리기 위한 4bit GPTQ-Pro 양자화 모델이 공개됐다.

Qwen3.6-27B4-bit GPTQ-Pro로 양자화해 소비자용 Ampere GPU에서도 현실적으로 돌릴 수 있게 만들었다.

대상은 RTX 3090, 3080, A5000, A6000 같은 카드이며, 목표는 데이터센터급 장비 없이도 27B 추론·코딩 모델을 로컬에서 빠르게 서빙하는 것이다.

핵심 포인트는 다음과 같다.

  • GPTQ-Pro + FOEM 양자화로 품질 손실을 줄임
  • Marlin 최적화로 고처리량 추론 지원
  • 2× RTX 3090에서 테스트
  • 생성 속도 약 64 tok/s
  • 첫 토큰 응답 시간 약 54 ms TTFT
  • vLLM으로 대형 컨텍스트 지원
  • Apache 2.0 라이선스

시작 예시는 vllm servegptq_marlin, tensor-parallel-size 2, max-model-len 132144 등을 넣는 구성이다.

모델 링크는 groxaxo/Qwen3.6-27B-GPTQ-Pro-4Bit, 프로젝트는 GPTQ-Pro다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.