AI Briefing

PFlash, prefill 10배

PFlash: 10x prefill speedup over llama.cpp at 128K on a RTX 3090

·2026.05.01 23:53

핵심 내용

PFlash가 RTX 3090에서 128K prefill 시간을 llama.cpp 대비 10배 줄였다.

자세히 보기

PFlash는 양자화된 27B급 모델의 긴 컨텍스트 prefill 병목을 줄이기 위해 speculative prefill을 적용했다. 작은 drafter가 전체 프롬프트의 토큰 중요도를 점수화하고, 대형 target 모델은 중요한 span만 prefill한다.

Qwen3.6-27B Q4_K_M를 RTX 3090에서 단일 샷으로 측정한 결과, 128K prompt의 TTFT는 24.8초로 vanilla llama.cpp의 약 257초 대비 10.4배 빨랐다. 64K에서도 13.5초 대 134.95초로 10.0배 개선됐고, NIAH retrieval은 끝까지 유지됐다.

  • vanilla llama.cpp는 131K 프롬프트에서 cold 248.4초, warmed 169.3초가 걸렸다.
  • 구현은 C++/CUDA only이며, inference loop에 Python/Triton/PyTorch를 쓰지 않는다.
  • 기반 아이디어는 Speculative Prefill, Cross-Family Speculative Prefill, FlashPrefill, Block-Sparse-Attention, ggml/llama.cpp다.
  • 코드는 MIT 라이선스로 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.