vLLM, AMD용 HIP W4A16 커널 지원
vLLM PR adding native HIP W4A16 kernel was merged
·2026.05.29 21:31
vLLM에 AMD GPU 성능을 최적화하는 네이티브 HIP W4A16 커널이 추가되었습니다.
vLLM 프로젝트에 AMD GPU(ROCm) 환경에서 4비트 양자화 모델의 추론 성능을 최적화하는 네이티브 HIP W4A16 커널이 병합되었습니다.
이번 업데이트로 RDNA3 아키텍처 기반 GPU에서 W4A16 양자화 모델의 추론 속도가 크게 향상되었습니다. Qwen3.6-27B-GPTQ-W4A16-G32 모델 기준 주요 벤치마크 결과는 다음과 같습니다:
- RDNA3 W4A16 (신규 커널) bf16: 205.3 tk/s
- RDNA3 W4A16 (신규 커널) fp16: 270.2 tk/s
기존 Triton 방식 대비 성능이 개선됨에 따라, AMD 하드웨어를 활용하여 LLM을 서빙하려는 개발자들에게 더 높은 효율성을 제공할 것으로 기대됩니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.