AI Briefing

CUDA+ROCm 동시 구동

Cuda + ROCm simultaneously with -DGGML_BACKEND_DL=ON !

·2026.05.01 07:46

핵심 내용

Windows에서 CUDA와 ROCm을 동시에 쓰는 llama.cpp 빌드법을 공유했다.

자세히 보기

Windows에서 llama.cpp를 CUDA와 ROCm에 동시에 연결해, Vulkan 없이 모델을 올리는 빌드·실행 절차가 공유됐다.

  • CMake에서 GGML_HIP=ON, GGML_CUDA=ON, GGML_BACKEND_DL=ON을 함께 활성화했다.
  • CMAKE_C_COMPILER, CMAKE_CXX_COMPILER, CMAKE_HIP_COMPILER는 ROCm 6.4의 clang-cl.exe로 지정했고, CUDA 컴파일러는 nvcc.exe를 사용했다.
  • GGML_CPU_ALL_VARIANTS=ON은 컴파일 오류를 일으켜 ggml/src/CMakeLists.txt에서 alderlake CPU variant를 주석 처리해야 했다.
  • Ryzen 5950X 환경에서 MiniMax-M2.7-UD-Q4_K_S를 실행했을 때 63/63개 레이어가 GPU로 오프로드됐고, CUDA 버퍼는 83,650.42 MiB, ROCm 버퍼는 40,314.35 MiB로 표시됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.