AI Briefing

Llama 3.2 1B, 480개 예제로 Android 탑재

Fine-tuned Llama 3.2 1B on 480 examples, shipped to Android via Q4_K_M

·2026.05.01 14:30

480개 예제로 미세조정한 Llama 3.2 1B를 Android 온디바이스로 배포했다.

Llama 3.2 1B480개의 손수 큐레이션한 ShareGPT 예제로 LoRA 미세조정한 뒤, Q4_K_M로 병합·양자화해 Android 앱에 올렸다.

  • 기본 모델: meta-llama/Llama-3.2-1B-Instruct
  • 튜닝: LoRA r=16, alpha=32, 대상 모듈 7개, 3 epoch, lr=2e-4
  • 최종 크기: 770MB
  • 런타임: Android에서 llamadartllama.cpp GPU backend 사용

실기기 측정에서는 다음 성능을 보였다.

  • Pixel 7 Pro: 약 25 tok/s, 로드 1.5초, 80토큰 생성 3~4초
  • Pixel 6a: 약 15 tok/s, 로드 2.5초, 80토큰 생성 4~5초
  • Samsung S22: 약 22 tok/s, 로드 2.0초, 80토큰 생성 3.5~4.5초

48개 홀드아웃 샘플 평가에서는 on-tone, specific, funny, category-correct 4개 기준으로 80%+ pass rate를 기록했다.

가장 눈에 띄는 점은 데이터 규모였다. 480개 수준에서 성능이 400개 안팎부터 평탄해졌고, 병목은 예제 수보다 데이터 품질이었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.