llama.cpp NVFP4 비교
llama.cpp benchmark native vs. non native NVFP4 on Blackwell - summary
·2026.04.29 21:27
핵심 내용
llama.cpp b8967의 native NVFP4가 프리필 속도를 최대 68% 높였지만 생성 속도는 거의 같았다.
자세히 보기
RTX 5090, Ryzen 9 9950X3D, 128GB DDR5 5600 CL36, CUDA 환경에서 Qwen3.6-27B-NVFP4를 llama.cpp b8966(비네이티브)와 b8967(네이티브)로 비교했다. llama-bench 표기는 qwen35 27B NVFP4였지만 실제 테스트 모델은 Qwen3.6-27B-NVFP4였다.
- 모델 설정: 17.50 GiB, 26.90B params,
ngl=999,fa=1 - 프롬프트 처리 성능은 b8967이 일관되게 앞섰고, 향상 폭은 **+42.6%~+68.3%**였다.
- 평균 프롬프트 처리 개선 폭은 약 **57%**였다.
pp512는 3295.10 → 5546.93 t/s,pp2048은 3373.30 → 5594.58 t/s로 올라 프리필이 크게 빨라졌다.pp512 @ d32768도 2514.70 → 3586.58 t/s,pp2048 @ d32768은 2479.39 → 3560.58 t/s를 기록했다.- 반면 토큰 생성 속도는 사실상 변하지 않아, 체감 이득은 긴 프롬프트, RAG, 문서 분석, 코드 중심 입력에서 가장 크다.
즉, native NVFP4 지원은 Blackwell에서 llama.cpp의 입력 처리 구간을 크게 끌어올렸지만, 생성 단계는 거의 그대로였다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.