NanoQuant: 대규모 언어 모델의 효율적인 1비트 미만 양자화
NanoQuant가 단일 H100 GPU로 70B LLM을 1비트 미만으로 압축한다.
NanoQuant는 대규모 언어 모델(LLM)의 가중치를 1비트 또는 1비트 미만으로 압축하는 후처리 양자화(PTQ) 방법이다. 70B 모델을 단일 NVIDIA H100 GPU에서 13시간 만에 압축하고, 저장 공간을 24배 줄여 8GB 소비자용 GPU에서도 추론할 수 있도록 한다.
기존 4비트 양자화는 산업 현장에서 널리 쓰이고 있지만, 1비트 양자화는 스케일 값과 그룹별 파라미터 같은 메타데이터 때문에 실제 저장 비용이 가중치당 2~3비트로 늘어나는 문제가 있다. 반면 1비트 양자화 인식 학습(QAT)은 수십억 개 토큰과 여러 GPU를 사용하는 전체 학습이 필요해 비용이 높다.
NanoQuant는 저랭크 이진 분해를 적용해 이 문제를 해결한다. 가중치 행렬을 두 개의 이진 행렬과 행·열별 스케일 벡터로 표현해, 이진 값의 저장량을 줄이고 메타데이터 오버헤드도 낮춘다. 적절한 저랭크 차원(rank)을 선택하면 전체 저장 비용을 가중치당 1비트 이하로 낮출 수 있다.
이진 행렬을 직접 최적화하는 과정은 조합적이고 비볼록적인 이산 최적화 문제다. 특히 PTQ는 128개 시퀀스 수준의 소규모 보정 데이터와 제한된 최적화 예산만 사용할 수 있어 초기화 품질이 중요하다.
NanoQuant의 보정 과정은 전역 헤시안 인식 보정과 순차적 블록 단위 재구성을 포함한 세 단계로 구성된다. 충분히 좋은 초기화를 확보해 가벼운 보정만으로도 경쟁력 있는 정확도를 달성하는 것이 핵심이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.