llama.cpp·ik_llama.cpp FP4 지원
FP4 inference in llama.cpp (NVFP4) and ik_llama.cpp (MXFP4) landed - Finally
·2026.04.26 00:42
핵심 내용
llama.cpp와 ik_llama.cpp에 서로 다른 FP4 추론 지원이 추가됐다.
자세히 보기
llama.cpp에 Nvidia 방식의 NVFP4 지원이 머지됐다. 관련 CUDA 커널은 mmq.cuh, mmvq.cu, convert.cu 등에 들어갔다.
ik_llama.cpp는 이미 MXFP4를 지원하고 있으며, CPU 쪽은 AVX2, NEON, Zen4, GPU 쪽은 CUDA까지 구현돼 있다.
두 포맷은 동일하지 않다.
- NVFP4: Nvidia의 블록 스케일드 FP4
- MXFP4: MX 컨소시엄 표준 FP4
둘 다 4비트 부동소수점 계열이라, 모델 지원이 따라오면 VRAM 절감 효과가 기대된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.