4비트 LLM, 원본 모델 성능 역전
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
핵심 내용
구조적 압축과 4비트 양자화 후 원본 모델보다 높은 성능을 회복하는 QAH 기법 공개.
자세히 보기
대규모 언어 모델(LLM)의 효율적 배포를 위해 구조적 압축과 4비트 양자화를 적용하면 추론 및 코드 생성 능력이 저하되는 문제가 발생한다. 기존 회복(Healing) 기법인 양자화 인식 학습(QAT)은 비용이 크고 불안정하며, 양자화 인식 증류(QAD)는 구조적 압축 후 생성된 bfloat16 체크포인트를 교사(teacher)로 사용해 성능 상한이 제한되는 한계가 있었다.
새로운 양자화 인식 힐링(QAH) 기법은 구조적 압축 전의 원본 풀 프리시전 모델을 직접 교사로 사용하여 증류한다. 교사와 학생 모델의 아키텍처가 달라도 출력 분포를 KL 발산으로 매칭하여 정보 전달이 가능하며, 이는 양자화 단계를 단순 손실 단계가 아닌 원본 모델로부터의 추가 증류 과정으로 재정의한다.
GPT-OSS 120B 모델을 60B 파라미터로 압축하고 MXFP4로 양자화한 결과, 9개 벤치마크 중 7개에서 원래의 bfloat16 모델보다 높은 성능을 기록했다. 이 방식은 모델 크기와 비용을 줄이면서도 정확도를 높이는 역전 현상을 보여주며, 장기 컨텍스트(32k 토큰) 처리를 위한 메모리 효율적 청크 KL 발산 손실 함수를 함께 제안했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.