AI Briefing

20GB 의료추론

We open-sourced Chaperone-Thinking-LQ-1.0 — a 4-bit GPTQ + QLoRA fine-tuned DeepSeek-R1-32B that hits 84% on MedQA in ~20GB[N]

·2026.04.22 05:07

핵심 내용

DeepSeek-R1-32B 기반 4-bit 추론모델을 20GB로 줄여 공개했다.

자세히 보기

DeepSeek-R1-Distill-Qwen-32B를 기반으로 한 Chaperone-Thinking-LQ-1.0을 Hugging Face에 오픈소스로 공개했다.

핵심은 4-bit GPTQ 양자화와 QLoRA 미세조정이다.

  • GPTQ로 모델 크기를 약 60GB → 20GB로 압축
  • calibration을 포함한 QAT로 정확도 손실을 최소화
  • 의료·과학 코퍼스로 QLoRA 추가 학습
  • adaptive identity layer는 제거해 아키텍처 출처를 투명하게 유지

공개된 성능은 다음과 같다.

  • MATH-500 91.9
  • MMLU 85.9
  • AIME 2024 66.7
  • GPQA Diamond 56.7
  • MedQA 84%

속도도 개선됐다.

  • 처리량: 36.86 tok/s
  • base DeepSeek-R1-32B: 22.84 tok/s
  • 약 1.6배 빠르고, median latency는 약 43% 감소

작성자는 이 모델이 단일 L40/L40s GPU에서 구동 가능하며, 데이터가 외부로 나가지 않아야 하는 온프레미스 의료 고객을 위해 설계됐다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.