AI Briefing

llama.cpp·ik_llama.cpp FP4 지원

FP4 inference in llama.cpp (NVFP4) and ik_llama.cpp (MXFP4) landed - Finally

·2026.04.26 00:42

llama.cpp와 ik_llama.cpp에 서로 다른 FP4 추론 지원이 추가됐다.

llama.cpp에 Nvidia 방식의 NVFP4 지원이 머지됐다. 관련 CUDA 커널은 mmq.cuh, mmvq.cu, convert.cu 등에 들어갔다.

ik_llama.cpp는 이미 MXFP4를 지원하고 있으며, CPU 쪽은 AVX2, NEON, Zen4, GPU 쪽은 CUDA까지 구현돼 있다.

두 포맷은 동일하지 않다.

  • NVFP4: Nvidia의 블록 스케일드 FP4
  • MXFP4: MX 컨소시엄 표준 FP4

둘 다 4비트 부동소수점 계열이라, 모델 지원이 따라오면 VRAM 절감 효과가 기대된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.