AI Briefing

ROCm 역전?

Strix Halo 128GB on Proxmox - Vulkan vs ROCm benchmark matrix

·2026.04.17 07:42

핵심 내용

Strix Halo 128GB에서 Vulkan과 ROCm을 비교하니 모델별 승부가 갈렸다.

자세히 보기

Ryzen AI MAX+ 395 기반 Bosgame M5와 128GB LPDDR5x 환경에서, Proxmox VE 9.1 LXC GPU passthrough로 llama.cpp를 돌려 Vulkan(b8816) 과 ROCm + rocWMMA(b8823) 를 비교했다.

  • 측정은 재부팅 후 cold 상태에서 진행했고, tuned accelerator-performance를 활성화했다.
  • 공통 옵션은 -ngl 999 -fa 1 --mmap 0 -b 4096 -ub 512 -t 8.

pp512 성능에서는 모델별로 결과가 갈렸다.

  • Gemma 4 26B-A4B: Vulkan ~1305 t/s, ROCm 1043 t/s로 Vulkan이 25% 빨랐다.
  • Qwen3.5 35B-A3B: Q4_K_M은 ROCm이 7%, Q8_0은 5% 앞섰다.
  • MXFP4_MOE에서는 ROCm 994 t/s vs Vulkan 693 t/s로 ROCm이 43% 우세했다.
  • GPT-OSS 120B는 ROCm 651 t/s가 Vulkan 468 t/s보다 39% 빨랐다.
  • Hermes 4.3 36B와 MiniMax M2.7 같은 일부 dense/경량 모델은 Vulkan이 우세하거나 비슷했다.

tg128 성능에서는 대부분 격차가 작았다.

  • Gemma 4 26B-A4B: Vulkan 54 t/s, ROCm 48 t/s
  • Qwen3.5 35B-A3B Q8_0: Vulkan 53 t/s, ROCm 45 t/s
  • GPT-OSS 120B: ROCm 37.5 t/s, Vulkan 34 t/s
  • Hermes 4.3 36B: 둘 다 10 t/s로 동일, 대역폭 한계로 해석

핵심은 표준 양자화는 Vulkan과 ROCm이 거의 비슷하지만, MXFP4 전용 모델에서는 ROCm이 크게 유리하다는 점이다. 반대로 Vulkan은 tuned accelerator-performance 적용 시 약 9.3% 추가 향상을 얻었고, ROCm은 변화가 사실상 없었다.

결론적으로 GPT-OSS 같은 MXFP4 모델은 ROCm이 사실상 필수이고, 그 외 대부분의 경우에는 Vulkan + tuned가 동급 이상이라는 실사용 벤치마크다.

부가적으로, Proxmox 기본 커널(6.17) + amdgpu 모듈로 LXC passthrough가 동작했고, ROCm **7.2.2 --no-dkms**를 privileged container에서 사용해도 되어 Proxmox 호스트에 amdgpu-dkms를 깔 필요가 없었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.