AMD MI300X 최적화 커널 공개
Creating custom kernels for the AMD MI300
·2025.07.09 09:00
Hugging Face와 AMD가 협력하여 Llama 3.1 405B의 성능을 극대화하는 MI300X 전용 커스텀 커널을 공개했다.
Hugging Face와 AMD가 협력하여 AMD MI300X GPU에서 Llama 3.1 405B 모델의 추론 성능을 최적화하기 위한 오픈소스 커스텀 커널을 개발했다.
이번 최적화는 vLLM 환경에서 FP8 정밀도를 사용할 때의 성능 향상을 목표로 하며, 다음과 같은 세 가지 핵심 커널을 포함한다:
- Fused residual connection, RMS norm 및 FP8 변환 커널
- Fused SwiGLU 활성화 및 FP8 변환 커널
- Skinny GEMM 커널
이 커널들을 조합하여 사용하면 MI300X 기반 노드에서 Llama 3.1 405B 모델의 디코딩 지연 시간(latency)을 유의미하게 단축할 수 있다.
개발된 커널은 hf-rocm-kernels GitHub 저장소를 통해 공개되었으며, 사용자는 이를 활용해 직접 벤치마킹을 수행하거나 자신만의 커널을 구축할 수 있다. 해당 커널들은 향후 AMD용 vLLM 프로젝트에 통합될 예정이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.