AI Briefing

맥·T4 양쪽 학습

Training LoRA adapters for Apple's on-device 3B model on a free Colab T4 and a Mac

·2026.04.21 00:05

QLoRA로 Apple 3B 모델을 T4와 Mac에서 학습하고 동등한 어댑터를 얻었다.

Apple이 제공한 12GB 체크포인트로는 일반 LoRA가 메모리 한계에 걸렸다.

  • 표준 LoRA는 모델 로드에 약 24GB, 학습에 약 15GB GPU가 필요했고, 24GB Mac에서도 OOM이 발생했다.
  • 이를 위해 memory-mapped loading + 4-bit quantization을 결합한 커스텀 QLoRA 파이프라인을 구성했다.
  • 이 방식으로 메모리는 약 1GB RAM, 학습 GPU 메모리는 약 5GB 수준으로 줄어들어 무료 Colab T424GB Mac에서 실행 가능했다.
  • Mac에서는 아직 정식 릴리스 전인 bitsandbytes Metal kernels(PR #1875) 를 git 설치해 사용했고, CPU fallback 대비 약 2배 빨라졌지만 T4보다는 여전히 약 4배 느렸다.
  • A100 LoRA, T4 QLoRA, Mac QLoRA 모두 동일한 어댑터 품질을 보였고, 작은 학습셋만으로도 정확도가 약 40% → 75%, retrieval과 결합하면 **약 86%**까지 올랐다.
  • 추가로, CLI 도구 호출 때마다 어댑터 복사본이 SIP 보호 캐시에 쌓이는 약 160MB 누적 버그가 발견됐고, 약 300회 벤치마크 동안 269GB의 숨은 디스크 사용량이 발생했다는 점도 확인됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.