Llama 3.2 1B, 480개 예제로 Android 탑재
Fine-tuned Llama 3.2 1B on 480 examples, shipped to Android via Q4_K_M
·2026.05.01 14:30
480개 예제로 미세조정한 Llama 3.2 1B를 Android 온디바이스로 배포했다.
Llama 3.2 1B를 480개의 손수 큐레이션한 ShareGPT 예제로 LoRA 미세조정한 뒤, Q4_K_M로 병합·양자화해 Android 앱에 올렸다.
- 기본 모델:
meta-llama/Llama-3.2-1B-Instruct - 튜닝: LoRA
r=16,alpha=32, 대상 모듈 7개, 3 epoch,lr=2e-4 - 최종 크기: 770MB
- 런타임: Android에서
llamadart와llama.cppGPU backend 사용
실기기 측정에서는 다음 성능을 보였다.
- Pixel 7 Pro: 약 25 tok/s, 로드 1.5초, 80토큰 생성 3~4초
- Pixel 6a: 약 15 tok/s, 로드 2.5초, 80토큰 생성 4~5초
- Samsung S22: 약 22 tok/s, 로드 2.0초, 80토큰 생성 3.5~4.5초
48개 홀드아웃 샘플 평가에서는 on-tone, specific, funny, category-correct 4개 기준으로 80%+ pass rate를 기록했다.
가장 눈에 띄는 점은 데이터 규모였다. 480개 수준에서 성능이 400개 안팎부터 평탄해졌고, 병목은 예제 수보다 데이터 품질이었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.