AI Briefing

Intel 하드웨어용 LLM 최적화 및 배포

Optimize and deploy with Optimum-Intel and OpenVINO GenAI

·2024.09.20 09:00

Optimum-Intel과 OpenVINO GenAI를 활용해 Intel 하드웨어에서 LLM을 최적화하고 배포하는 방법을 다룬다.

엣지 및 클라이언트 환경에서 Transformers 모델을 효율적으로 배포하기 위해 Optimum-IntelOpenVINO GenAI를 활용하는 방법을 다룬다.

**OpenVINO™**는 C++ 기반 AI 추론 솔루션으로, GenAI API를 통해 LLM을 C++ 또는 Python 애플리케이션에 간편하게 통합하고 성능을 높일 수 있도록 지원한다.

핵심 프로세스는 다음과 같다:

  • 모델 내보내기: Optimum-IntelOVModelForCausalLM API 또는 CLI를 사용하여 모델을 OpenVINO IR(Intermediate Representation) 형식으로 변환한다.
  • 모델 최적화: 리소스가 제한된 환경을 위해 **NNCF(Neural Network Compression Framework)**를 통한 가중치 양자화(Weight-only quantization)를 적용한다.
  • 양자화 기법: INT8/INT4 양자화뿐만 아니라 AWQ, GPTQ 등 데이터 인지(data-aware) 방식을 지원하여 정확도와 성능의 균형을 최적화한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.