hipfire HFQ4 prefill 3배 향상
I got 3× faster HFQ4 prefill on Strix Halo in hipfire with an opt-in MMQ path
·2026.04.28 14:57
HFQ4 prefill에 opt-in MMQ를 붙여 Strix Halo 속도가 3배 이상 빨라졌다.
hipfire에 HFQ4-G256 prefill용 opt-in MMQ 경로가 추가됐다.
HIPFIRE_MMQ=1로 켜는 방식이며, 대상은 gfx1100, gfx1101, gfx1102, gfx1103, gfx1150, gfx1151이다.
구현은 prefill 활성값을 Q8_1 MMQ layout으로 미리 양자화하고, i8 WMMA와 128×128 출력/배치 타일, LDS staging을 사용한다.
Strix Halo / gfx1151에서 Qwen3.5 9B HFQ4/MQ4를 돌린 결과, 긴 prefill 처리량이 기존 310~340 tok/s에서 1140~1260 tok/s 수준으로 올라갔다.
q81024pp: 328.9 → 1222.7 tok/s (3.72x)asym31024pp: 329.9 → 1259.1 tok/s (3.82x)- 전체 표에서도 KV mode별로 약 3.0~3.9배 속도 향상이 확인됐다.
기본값은 아니고, llama.cpp의 AMD MMQ prompt-processing 경로와 비슷한 형태다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.