AI Briefing

llama.cpp NVFP4 비교

llama.cpp benchmark native vs. non native NVFP4 on Blackwell - summary

·2026.04.29 21:27

핵심 내용

llama.cpp b8967의 native NVFP4가 프리필 속도를 최대 68% 높였지만 생성 속도는 거의 같았다.

자세히 보기

RTX 5090, Ryzen 9 9950X3D, 128GB DDR5 5600 CL36, CUDA 환경에서 Qwen3.6-27B-NVFP4를 llama.cpp b8966(비네이티브)와 b8967(네이티브)로 비교했다. llama-bench 표기는 qwen35 27B NVFP4였지만 실제 테스트 모델은 Qwen3.6-27B-NVFP4였다.

  • 모델 설정: 17.50 GiB, 26.90B params, ngl=999, fa=1
  • 프롬프트 처리 성능은 b8967이 일관되게 앞섰고, 향상 폭은 **+42.6%~+68.3%**였다.
  • 평균 프롬프트 처리 개선 폭은 약 **57%**였다.
  • pp512는 3295.10 → 5546.93 t/s, pp2048은 3373.30 → 5594.58 t/s로 올라 프리필이 크게 빨라졌다.
  • pp512 @ d32768도 2514.70 → 3586.58 t/s, pp2048 @ d32768은 2479.39 → 3560.58 t/s를 기록했다.
  • 반면 토큰 생성 속도는 사실상 변하지 않아, 체감 이득은 긴 프롬프트, RAG, 문서 분석, 코드 중심 입력에서 가장 크다.

즉, native NVFP4 지원은 Blackwell에서 llama.cpp의 입력 처리 구간을 크게 끌어올렸지만, 생성 단계는 거의 그대로였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.