AI Briefing

Hugging Face, AMD GPU 가속 지원 확대

AMD + 🤗: Large Language Models Out-of-the-Box Acceleration with AMD GPU

·2023.12.05 09:00

Hugging Face가 AMD Instinct GPU에서 별도 코드 수정 없이 LLM을 실행할 수 있는 최적화 지원을 발표했다.

Hugging Face와 AMD의 파트너십을 통해 AMD Instinct GPU(MI250X, MI300 시리즈 등)에서 최신 AI 모델을 최적의 성능으로 실행할 수 있는 환경이 구축되었다.

주요 업데이트 사항은 다음과 같다:

  • 코드 변경 없는 실행: 기존 NVIDIA GPU용 코드(torch.device("cuda"))를 수정 없이 그대로 AMD GPU에서 사용할 수 있도록 지원한다.
  • 최신 가속 기술 통합:
    • Flash Attention v2 (AMD 오픈소스 버전)
    • vLLM의 Paged Attention 및 ROCm용 융합 커널(Fused Kernels)
    • DeepSpeed (ROCm 기반 GPU 공식 검증 완료)
    • GPTQ (AutoGPTQ 및 Transformers 통합을 통한 양자화 지원)
    • ONNX Runtime (ROCmExecutionProvider를 통한 ONNX 모델 실행)
  • 성능 벤치마크 도구: Optimum-Benchmark를 통해 분산 환경 및 다양한 최적화/양자화 설정에서의 성능 측정이 가능하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.