AI Briefing

Llama 3 1.58비트 파인튜닝 기술 공개

Fine-tuning LLMs to 1.58bit: extreme quantization made easy

·2024.09.18 09:00

기존 LLM을 1.58비트 BitNet 아키텍처로 파인튜닝하여 연산 효율을 극대화하는 방법과 모델을 공개했다.

Microsoft Research가 제안한 BitNet 아키텍처는 파라미터를 -1, 0, 1의 세 가지 값으로만 표현하여 1.58비트라는 극단적인 양자화를 구현한다. 이는 기존 FP16 방식 대비 행렬 곱셈 시 에너지 소비를 획기적으로 줄일 수 있는 새로운 연산 패러다임을 제시한다.

기존에는 BitNet을 사용하려면 모델을 처음부터 다시 학습시켜야 하는 비용 문제가 있었으나, HuggingFace는 기존 모델을 1.58비트로 변환할 수 있는 파인튜닝 기법을 개발했다.

주요 성과는 다음과 같다:

  • Llama 3 8B 모델을 활용하여 10B 및 100B 토큰 규모로 파인튜닝한 모델을 출시했다.
  • 해당 모델들은 MMLU 벤치마크에서 Llama 1 7B 모델의 성능을 상회하는 결과를 보였다.
  • transformers 라이브러리에 새로운 'bitnet' 양자화 방식을 도입하여, 별도의 API 변경 없이 기존 방식과 동일하게 모델을 로드하고 사용할 수 있다.

이 기술을 통해 모델의 메모리 사용량을 줄이면서도 높은 성능을 유지하는 효율적인 배포가 가능해질 전망이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.