PFlash, prefill 10배
PFlash: 10x prefill speedup over llama.cpp at 128K on a RTX 3090
·2026.05.01 23:53
PFlash가 RTX 3090에서 128K prefill 시간을 llama.cpp 대비 10배 줄였다.
PFlash는 양자화된 27B급 모델의 긴 컨텍스트 prefill 병목을 줄이기 위해 speculative prefill을 적용했다. 작은 drafter가 전체 프롬프트의 토큰 중요도를 점수화하고, 대형 target 모델은 중요한 span만 prefill한다.
Qwen3.6-27B Q4_K_M를 RTX 3090에서 단일 샷으로 측정한 결과, 128K prompt의 TTFT는 24.8초로 vanilla llama.cpp의 약 257초 대비 10.4배 빨랐다. 64K에서도 13.5초 대 134.95초로 10.0배 개선됐고, NIAH retrieval은 끝까지 유지됐다.
- vanilla llama.cpp는 131K 프롬프트에서 cold 248.4초, warmed 169.3초가 걸렸다.
- 구현은 C++/CUDA only이며, inference loop에 Python/Triton/PyTorch를 쓰지 않는다.
- 기반 아이디어는 Speculative Prefill, Cross-Family Speculative Prefill, FlashPrefill, Block-Sparse-Attention, ggml/llama.cpp다.
- 코드는 MIT 라이선스로 공개됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.