llama.cpp NVFP4 비교
llama.cpp benchmark native vs. non native NVFP4 on Blackwell - summary
·2026.04.29 21:27
llama.cpp b8967의 native NVFP4가 프리필 속도를 최대 68% 높였지만 생성 속도는 거의 같았다.
RTX 5090, Ryzen 9 9950X3D, 128GB DDR5 5600 CL36, CUDA 환경에서 Qwen3.6-27B-NVFP4를 llama.cpp b8966(비네이티브)와 b8967(네이티브)로 비교했다. llama-bench 표기는 qwen35 27B NVFP4였지만 실제 테스트 모델은 Qwen3.6-27B-NVFP4였다.
- 모델 설정: 17.50 GiB, 26.90B params,
ngl=999,fa=1 - 프롬프트 처리 성능은 b8967이 일관되게 앞섰고, 향상 폭은 **+42.6%~+68.3%**였다.
- 평균 프롬프트 처리 개선 폭은 약 **57%**였다.
pp512는 3295.10 → 5546.93 t/s,pp2048은 3373.30 → 5594.58 t/s로 올라 프리필이 크게 빨라졌다.pp512 @ d32768도 2514.70 → 3586.58 t/s,pp2048 @ d32768은 2479.39 → 3560.58 t/s를 기록했다.- 반면 토큰 생성 속도는 사실상 변하지 않아, 체감 이득은 긴 프롬프트, RAG, 문서 분석, 코드 중심 입력에서 가장 크다.
즉, native NVFP4 지원은 Blackwell에서 llama.cpp의 입력 처리 구간을 크게 끌어올렸지만, 생성 단계는 거의 그대로였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.