맥·T4 양쪽 학습
Training LoRA adapters for Apple's on-device 3B model on a free Colab T4 and a Mac
·2026.04.21 00:05
핵심 내용
QLoRA로 Apple 3B 모델을 T4와 Mac에서 학습하고 동등한 어댑터를 얻었다.
자세히 보기
Apple이 제공한 12GB 체크포인트로는 일반 LoRA가 메모리 한계에 걸렸다.
- 표준 LoRA는 모델 로드에 약 24GB, 학습에 약 15GB GPU가 필요했고, 24GB Mac에서도 OOM이 발생했다.
- 이를 위해 memory-mapped loading + 4-bit quantization을 결합한 커스텀 QLoRA 파이프라인을 구성했다.
- 이 방식으로 메모리는 약 1GB RAM, 학습 GPU 메모리는 약 5GB 수준으로 줄어들어 무료 Colab T4와 24GB Mac에서 실행 가능했다.
- Mac에서는 아직 정식 릴리스 전인 bitsandbytes Metal kernels(PR #1875) 를 git 설치해 사용했고, CPU fallback 대비 약 2배 빨라졌지만 T4보다는 여전히 약 4배 느렸다.
- A100 LoRA, T4 QLoRA, Mac QLoRA 모두 동일한 어댑터 품질을 보였고, 작은 학습셋만으로도 정확도가 약 40% → 75%, retrieval과 결합하면 **약 86%**까지 올랐다.
- 추가로, CLI 도구 호출 때마다 어댑터 복사본이 SIP 보호 캐시에 쌓이는 약 160MB 누적 버그가 발견됐고, 약 300회 벤치마크 동안 269GB의 숨은 디스크 사용량이 발생했다는 점도 확인됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.