AI Briefing

hipfire HFQ4 prefill 3배 향상

I got 3× faster HFQ4 prefill on Strix Halo in hipfire with an opt-in MMQ path

·2026.04.28 14:57

핵심 내용

HFQ4 prefill에 opt-in MMQ를 붙여 Strix Halo 속도가 3배 이상 빨라졌다.

자세히 보기

hipfire에 HFQ4-G256 prefill용 opt-in MMQ 경로가 추가됐다.

HIPFIRE_MMQ=1로 켜는 방식이며, 대상은 gfx1100, gfx1101, gfx1102, gfx1103, gfx1150, gfx1151이다.

구현은 prefill 활성값을 Q8_1 MMQ layout으로 미리 양자화하고, i8 WMMA와 128×128 출력/배치 타일, LDS staging을 사용한다.

Strix Halo / gfx1151에서 Qwen3.5 9B HFQ4/MQ4를 돌린 결과, 긴 prefill 처리량이 기존 310~340 tok/s에서 1140~1260 tok/s 수준으로 올라갔다.

  • q8 1024pp: 328.9 → 1222.7 tok/s (3.72x)
  • asym3 1024pp: 329.9 → 1259.1 tok/s (3.82x)
  • 전체 표에서도 KV mode별로 약 3.0~3.9배 속도 향상이 확인됐다.

기본값은 아니고, llama.cpp의 AMD MMQ prompt-processing 경로와 비슷한 형태다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.