AI Briefing

NVIDIA, 모델 경량화 도구 공개

NVIDIA Model Optimizer: 모델을 경량화하여 vLLM / TensorRT / SGLang 등의 추론 서버용 배포용 체크포인트를 만드는 프로젝트

·2026.09.02 09:30

핵심 내용

NVIDIA가 양자화, 가지치기 등 6가지 최적화 기법을 통합한 Model Optimizer를 공개하여 vLLM, TensorRT-LLM 등 추론 엔진용 체크포인트 생성을 지원한다.

1 / 2

자세히 보기

NVIDIA가 LLM 추론 시 메모리 및 지연 시간 문제를 해결하기 위해 NVIDIA Model Optimizer를 공개했다. 이 라이브러리는 양자화, 가지치기, 지식 증류 등 분산된 최적화 기법을 하나로 통합하며, 결과물을 vLLM, TensorRT-LLM, SGLang 등 주요 추론 엔진이 즉시 로드할 수 있는 체크포인트 형식으로 내보낸다.

주요 최적화 기법 및 특징

Model Optimizer는 학습 필요 여부에 따라 6가지 기법을 제공한다.

  • 학습 불필요: 학습 후 양자화(PTQ), 희소성(Sparsity). 보정 데이터만으로 GPU 수 장에서 빠르게 적용 가능.
  • 학습 필요: 양자화 인식 학습(QAT), 지식 증류, 추측 디코딩, 가지치기(재학습 병행). Megatron-Bridge 및 Hugging Face Accelerate와 연동하여 학습 파이프라인을 구성한다.

Nemotron-3-Nano-30B-A3B 모델에 가지치기와 FP8 양자화를 적용한 사례에서는 vLLM 처리량과 메모리 사용량이 각각 2.6배 개선되었다.

양자화 방식 선택 가이드

실무에서는 배치 크기와 GPU 세대에 따라 최적의 양자화 방식을 선택해야 한다.

  • FP8: 정확도 손실이 매우 낮고 원본의 50% 크기로 압축. Ada/Hopper 이후 GPU 권장. NVIDIA는 이를 기본 추천 방식으로 제시한다.
  • INT4 AWQ (W4A16): 소배치(배치 4 이하) 추론에서 유리. 원본의 25% 크기로 압축되나 대배치 성능은 낮다.
  • INT4-FP8 AWQ (W4A8): 대배치 서빙 환경에서 가중치와 활성값을 함께 양자화하여 성능을 확보한다.

벤치마크 결과, Llama3.1-70B 모델에서 배치 64 기준 INT4 AWQ는 기준선 대비 0.88배로 오히려 느려지는 등, 무조건 낮은 비트 수를 선택하면 서빙 환경에서 손해가 발생할 수 있다. 반면 FP8은 배치 64에서 2.10배의 속도 향상을 보였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.