AI Briefing

Intel Xeon에서 StarCoder 추론 7배 가속

Accelerate StarCoder with 🤗 Optimum Intel on Xeon: Q8/Q4 and Speculative Decoding

·2024.01.30 09:00

Optimum Intel과 양자화 기술을 통해 Intel Xeon 프로세서에서 StarCoder의 추론 성능을 7배 이상 개선했다.

Intel 4세대 Xeon 프로세서에서 StarCoder-15B 모델의 추론 속도를 7배 이상 가속화하는 최적화 성과를 발표했다.

핵심 최적화 전략은 다음과 같다:

  • 양자화(Quantization): 메모리 대역폭 병목을 해결하기 위해 8비트(INT8)4비트 양자화를 적용했다. 가중치만 양자화하는 **Weight Only Quantization(WOQ)**과 가중치 및 활성화 함수를 모두 양자화하는 Static Quantization(SQ) 방식을 활용한다.
  • Speculative Decoding: Assisted Generation 기술을 통합하여 추론 효율을 극대화했다.
  • 하드웨어 가속: 4세대 Xeon의 **Intel® Advanced Matrix Extensions(AMX)**를 활용하여 BFloat16 및 Int8 연산을 가속화했다.

이 기술은 Hugging Face Optimum Intel과 **Intel Extension for PyTorch(IPEX)**를 통해 구현되어, 코드 생성 LLM을 Intel 인프라에서 더욱 효율적으로 배포할 수 있게 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.