AI Briefing

Unsloth, LLM 파인튜닝 속도 2배 향상

Make LLM Fine-tuning 2x faster with Unsloth and 🤗 TRL

·2024.01.10 09:00

Unsloth 라이브러리를 통해 LLM 파인튜닝 속도를 최대 2배 높이고 메모리 사용량을 40% 절감할 수 있다.

Unsloth는 Hugging Face 생태계(Hub, transformers, PEFT, TRL)와 완벽하게 호환되는 경량화된 LLM 파인튜닝 라이브러리다.

Triton 커널을 사용하여 PyTorch 모듈을 직접 재작성함으로써 메모리 사용량을 줄이고 연산 속도를 높인다. 최적화 과정에서 근사치를 사용하지 않기 때문에 기존 QLoRA 대비 **정확도 저하가 0%**라는 것이 핵심적인 특징이다.

주요 벤치마크 결과:

  • 속도 향상: A100 환경에서 Code Llama 34b 기준 약 1.94배, T4 환경에서 Tiny Llama 1.1b 기준 최대 3.87배 빠른 성능을 보인다.
  • 메모리 절감: 모델에 따라 VRAM 사용량을 최대 74%까지 절감할 수 있다.

현재 Llama, Mistral, Yi, Deepseek, TinyLlama 등 다양한 아키텍처를 지원하며, FastLanguageModel API를 통해 기존 Transformers 라이브러리와 유사한 방식으로 간편하게 사용할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.