20GB로 84%
We open-sourced Chaperone-Thinking-LQ-1.0 — a 4-bit GPTQ + QLoRA fine-tuned DeepSeek-R1-32B that hits 84% on MedQA in ~20GB
·2026.04.21 03:58
핵심 내용
4-bit GPTQ+QLoRA로 DeepSeek-R1 계열을 의료용으로 압축·튜닝했다.
자세히 보기
Chaperone-Thinking-LQ-1.0을 오픈소스로 공개했다. 기반은 DeepSeek-R1-Distill-Qwen-32B이며, 단순 양자화가 아니라 추론용 파이프라인을 함께 적용했다.
- 4-bit GPTQ quantization으로 모델 크기를 약 60GB → 20GB로 줄였다.
- GPTQ 기반 QAT와 calibration으로 양자화 손실을 최소화했다.
- 의료·과학 코퍼스 QLoRA fine-tuning을 추가했다.
- 투명성을 위해 adaptive identity layer는 제거했다고 밝혔다.
벤치마크에서는 다음 성능을 제시했다.
- MATH-500: 91.9
- MMLU: 85.9
- AIME 2024: 66.7
- GPQA Diamond: 56.7
- MedQA: 84%
특히 **MedQA 84%**를 강조하며, **GPT-4o 약 88%**와 4포인트 차이라고 설명했다. 또한 이 모델이 단일 L40/L40s GPU에 올라가며, base DeepSeek-R1-32B 대비 36.86 tok/s vs 22.84 tok/s, 즉 약 1.6배 처리량과 약 43% 낮은 median latency를 보였다고 주장했다.
목적은 데이터가 외부로 나가면 안 되는 온프레미스 헬스케어 환경에서 쓸 수 있는 추론 모델 확보다. 모델과 관련 자료는 Hugging Face에서 공개됐고, 라이선스는 CC-BY-4.0이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.