AI Briefing

AMD RDNA3 최적화 추론 엔진 hipEngine

hipEngine: Fast Native Qwen 3.6 Inference for RDNA3 (Strix Halo, 7900 XTX)

·2026.05.25 07:21

AMD RDNA3 GPU 환경에서 Qwen 3.6 모델의 추론 성능을 극대화한 오픈소스 엔진 hipEngine이 공개되었다.

hipEngine은 AMD ROCm 환경에 최적화된 새로운 오픈소스(AGPLv3) 로컬 LLM 추론 엔진이다.

Python 기반으로 설계되었으나, 핵심 연산(hot-path)은 **HIP/C++**로 구현되어 hipBLASLt, hipGraph, AOTriton 등 AMD 네이티브 라이브러리를 활용해 성능을 극대화했다.

Qwen 3.6 (MoE 및 Dense) 모델을 대상으로 gfx1100(Radeon RX 7900 XTX 등)에서 벤치마크를 진행한 결과, llama.cpp 대비 우수한 Prefill(프롬프트 처리) 성능을 확인했다.

특히 **ParoQuant(4.68bpw)**를 적용했을 때, 512에서 128K에 이르는 다양한 컨텍스트 길이에서 llama.cpp(HIP 및 Vulkan)보다 빠른 토큰 처리 속도를 기록했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.