PFlash, prefill 10배
PFlash: 10x prefill speedup over llama.cpp at 128K on a RTX 3090
·2026.05.01 23:53
핵심 내용
PFlash가 RTX 3090에서 128K prefill 시간을 llama.cpp 대비 10배 줄였다.
자세히 보기
PFlash는 양자화된 27B급 모델의 긴 컨텍스트 prefill 병목을 줄이기 위해 speculative prefill을 적용했다. 작은 drafter가 전체 프롬프트의 토큰 중요도를 점수화하고, 대형 target 모델은 중요한 span만 prefill한다.
Qwen3.6-27B Q4_K_M를 RTX 3090에서 단일 샷으로 측정한 결과, 128K prompt의 TTFT는 24.8초로 vanilla llama.cpp의 약 257초 대비 10.4배 빨랐다. 64K에서도 13.5초 대 134.95초로 10.0배 개선됐고, NIAH retrieval은 끝까지 유지됐다.
- vanilla llama.cpp는 131K 프롬프트에서 cold 248.4초, warmed 169.3초가 걸렸다.
- 구현은 C++/CUDA only이며, inference loop에 Python/Triton/PyTorch를 쓰지 않는다.
- 기반 아이디어는 Speculative Prefill, Cross-Family Speculative Prefill, FlashPrefill, Block-Sparse-Attention, ggml/llama.cpp다.
- 코드는 MIT 라이선스로 공개됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.