AI Briefing

Intel 하드웨어용 LLM 최적화 및 배포

Optimize and deploy with Optimum-Intel and OpenVINO GenAI

·2024.09.20 09:00

핵심 내용

Optimum-Intel과 OpenVINO GenAI를 활용해 Intel 하드웨어에서 LLM을 최적화하고 배포하는 방법을 다룬다.

자세히 보기

엣지 및 클라이언트 환경에서 Transformers 모델을 효율적으로 배포하기 위해 Optimum-Intel과 OpenVINO GenAI를 활용하는 방법을 다룬다.

**OpenVINO™**는 C++ 기반 AI 추론 솔루션으로, GenAI API를 통해 LLM을 C++ 또는 Python 애플리케이션에 간편하게 통합하고 성능을 높일 수 있도록 지원한다.

핵심 프로세스는 다음과 같다:

  • 모델 내보내기: Optimum-Intel의 OVModelForCausalLM API 또는 CLI를 사용하여 모델을 OpenVINO IR(Intermediate Representation) 형식으로 변환한다.
  • 모델 최적화: 리소스가 제한된 환경을 위해 **NNCF(Neural Network Compression Framework)**를 통한 가중치 양자화(Weight-only quantization)를 적용한다.
  • 양자화 기법: INT8/INT4 양자화뿐만 아니라 AWQ, GPTQ 등 데이터 인지(data-aware) 방식을 지원하여 정확도와 성능의 균형을 최적화한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.