Hugging Face, AMD GPU 가속 지원 확대
AMD + 🤗: Large Language Models Out-of-the-Box Acceleration with AMD GPU
·2023.12.05 09:00
핵심 내용
Hugging Face가 AMD Instinct GPU에서 별도 코드 수정 없이 LLM을 실행할 수 있는 최적화 지원을 발표했다.
자세히 보기
Hugging Face와 AMD의 파트너십을 통해 AMD Instinct GPU(MI250X, MI300 시리즈 등)에서 최신 AI 모델을 최적의 성능으로 실행할 수 있는 환경이 구축되었다.
주요 업데이트 사항은 다음과 같다:
- 코드 변경 없는 실행: 기존 NVIDIA GPU용 코드(
torch.device("cuda"))를 수정 없이 그대로 AMD GPU에서 사용할 수 있도록 지원한다. - 최신 가속 기술 통합:
- Flash Attention v2 (AMD 오픈소스 버전)
- vLLM의 Paged Attention 및 ROCm용 융합 커널(Fused Kernels)
- DeepSpeed (ROCm 기반 GPU 공식 검증 완료)
- GPTQ (AutoGPTQ 및 Transformers 통합을 통한 양자화 지원)
- ONNX Runtime (ROCmExecutionProvider를 통한 ONNX 모델 실행)
- 성능 벤치마크 도구: Optimum-Benchmark를 통해 분산 환경 및 다양한 최적화/양자화 설정에서의 성능 측정이 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.