AI Briefing

hipfire HFQ4 prefill 3배 향상

I got 3× faster HFQ4 prefill on Strix Halo in hipfire with an opt-in MMQ path

·2026.04.28 14:57

HFQ4 prefill에 opt-in MMQ를 붙여 Strix Halo 속도가 3배 이상 빨라졌다.

hipfire에 HFQ4-G256 prefill용 opt-in MMQ 경로가 추가됐다.

HIPFIRE_MMQ=1로 켜는 방식이며, 대상은 gfx1100, gfx1101, gfx1102, gfx1103, gfx1150, gfx1151이다.

구현은 prefill 활성값을 Q8_1 MMQ layout으로 미리 양자화하고, i8 WMMA128×128 출력/배치 타일, LDS staging을 사용한다.

Strix Halo / gfx1151에서 Qwen3.5 9B HFQ4/MQ4를 돌린 결과, 긴 prefill 처리량이 기존 310~340 tok/s에서 1140~1260 tok/s 수준으로 올라갔다.

  • q8 1024pp: 328.9 → 1222.7 tok/s (3.72x)
  • asym3 1024pp: 329.9 → 1259.1 tok/s (3.82x)
  • 전체 표에서도 KV mode별로 약 3.0~3.9배 속도 향상이 확인됐다.

기본값은 아니고, llama.cpp의 AMD MMQ prompt-processing 경로와 비슷한 형태다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.