AI Briefing

llama.cpp·ik_llama.cpp FP4 지원

FP4 inference in llama.cpp (NVFP4) and ik_llama.cpp (MXFP4) landed - Finally

·2026.04.26 00:42

핵심 내용

llama.cpp와 ik_llama.cpp에 서로 다른 FP4 추론 지원이 추가됐다.

자세히 보기

llama.cpp에 Nvidia 방식의 NVFP4 지원이 머지됐다. 관련 CUDA 커널은 mmq.cuh, mmvq.cu, convert.cu 등에 들어갔다.

ik_llama.cpp는 이미 MXFP4를 지원하고 있으며, CPU 쪽은 AVX2, NEON, Zen4, GPU 쪽은 CUDA까지 구현돼 있다.

두 포맷은 동일하지 않다.

  • NVFP4: Nvidia의 블록 스케일드 FP4
  • MXFP4: MX 컨소시엄 표준 FP4

둘 다 4비트 부동소수점 계열이라, 모델 지원이 따라오면 VRAM 절감 효과가 기대된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.