AI Briefing

Hugging Face, AMD GPU 가속 지원 확대

AMD + 🤗: Large Language Models Out-of-the-Box Acceleration with AMD GPU

·2023.12.05 09:00

핵심 내용

Hugging Face가 AMD Instinct GPU에서 별도 코드 수정 없이 LLM을 실행할 수 있는 최적화 지원을 발표했다.

자세히 보기

Hugging Face와 AMD의 파트너십을 통해 AMD Instinct GPU(MI250X, MI300 시리즈 등)에서 최신 AI 모델을 최적의 성능으로 실행할 수 있는 환경이 구축되었다.

주요 업데이트 사항은 다음과 같다:

  • 코드 변경 없는 실행: 기존 NVIDIA GPU용 코드(torch.device("cuda"))를 수정 없이 그대로 AMD GPU에서 사용할 수 있도록 지원한다.
  • 최신 가속 기술 통합:
    • Flash Attention v2 (AMD 오픈소스 버전)
    • vLLM의 Paged Attention 및 ROCm용 융합 커널(Fused Kernels)
    • DeepSpeed (ROCm 기반 GPU 공식 검증 완료)
    • GPTQ (AutoGPTQ 및 Transformers 통합을 통한 양자화 지원)
    • ONNX Runtime (ROCmExecutionProvider를 통한 ONNX 모델 실행)
  • 성능 벤치마크 도구: Optimum-Benchmark를 통해 분산 환경 및 다양한 최적화/양자화 설정에서의 성능 측정이 가능하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.