ROCm 역전?
Strix Halo 128GB on Proxmox - Vulkan vs ROCm benchmark matrix
핵심 내용
Strix Halo 128GB에서 Vulkan과 ROCm을 비교하니 모델별 승부가 갈렸다.
자세히 보기
Ryzen AI MAX+ 395 기반 Bosgame M5와 128GB LPDDR5x 환경에서, Proxmox VE 9.1 LXC GPU passthrough로 llama.cpp를 돌려 Vulkan(b8816) 과 ROCm + rocWMMA(b8823) 를 비교했다.
- 측정은 재부팅 후 cold 상태에서 진행했고,
tuned accelerator-performance를 활성화했다. - 공통 옵션은
-ngl 999 -fa 1 --mmap 0 -b 4096 -ub 512 -t 8.
pp512 성능에서는 모델별로 결과가 갈렸다.
- Gemma 4 26B-A4B: Vulkan ~1305 t/s, ROCm 1043 t/s로 Vulkan이 25% 빨랐다.
- Qwen3.5 35B-A3B:
Q4_K_M은 ROCm이 7%,Q8_0은 5% 앞섰다. - MXFP4_MOE에서는 ROCm 994 t/s vs Vulkan 693 t/s로 ROCm이 43% 우세했다.
- GPT-OSS 120B는 ROCm 651 t/s가 Vulkan 468 t/s보다 39% 빨랐다.
- Hermes 4.3 36B와 MiniMax M2.7 같은 일부 dense/경량 모델은 Vulkan이 우세하거나 비슷했다.
tg128 성능에서는 대부분 격차가 작았다.
- Gemma 4 26B-A4B: Vulkan 54 t/s, ROCm 48 t/s
- Qwen3.5 35B-A3B Q8_0: Vulkan 53 t/s, ROCm 45 t/s
- GPT-OSS 120B: ROCm 37.5 t/s, Vulkan 34 t/s
- Hermes 4.3 36B: 둘 다 10 t/s로 동일, 대역폭 한계로 해석
핵심은 표준 양자화는 Vulkan과 ROCm이 거의 비슷하지만, MXFP4 전용 모델에서는 ROCm이 크게 유리하다는 점이다. 반대로 Vulkan은 tuned accelerator-performance 적용 시 약 9.3% 추가 향상을 얻었고, ROCm은 변화가 사실상 없었다.
결론적으로 GPT-OSS 같은 MXFP4 모델은 ROCm이 사실상 필수이고, 그 외 대부분의 경우에는 Vulkan + tuned가 동급 이상이라는 실사용 벤치마크다.
부가적으로, Proxmox 기본 커널(6.17) + amdgpu 모듈로 LXC passthrough가 동작했고, ROCm **7.2.2 --no-dkms**를 privileged container에서 사용해도 되어 Proxmox 호스트에 amdgpu-dkms를 깔 필요가 없었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.