AI Briefing

GGUF 파일명-실제 비트 불일치

I audited 443 GGUF quants across 25 repos. 64 of them can't be the quant their filename claims.

·2026.08.29 05:20

핵심 내용

llama.cpp의 양자화 로직 문제로 GGUF 파일명이 실제 저장된 비트 수와 다른 사례가 다수 발견됐다.

자세히 보기

llama.cpp의 양자화 도구가 특정 조건에서 파일명과 실제 저장된 비트 수(bits per weight, bpw)가 일치하지 않는 파일을 생성하는 문제가 확인됐다. 25개 저장소의 GGUF 파일 443개를 감사한 결과, 64개 파일이 파일명에 표기된 양자화 유형과 실제 데이터가 달랐다.

원인 및 메커니즘

k-quant와 i-quant는 첫 번째 텐서 차원이 256으로 나누어떨어져야 한다. 이 조건을 충족하지 못하면 llama-quantize는 요청된 저비트 유형 대신 호환되는 32블록 유형(예: IQ4_NL 또는 Q4_0)으로 대체한다. 이로 인해 사용자가 요청한 저비트 모델이 실제로는 약 4.5 bpw로 저장되지만, 파일명과 모델 카드, 메타데이터에는 여전히 원래 요청된 유형(예: IQ2_XXS)이 그대로 표기된다.

영향 및 사례

이 문제는 2023년 PR #3747부터 존재해 왔으며, 양자화 로그에는 경고가 출력되지만 완성된 GGUF 파일을 다운로드하는 사용자는 이를 확인할 수 없다. 대표적인 사례로 Nemotron-3.5-Lightning 모델은 n_embd가 2688이고 전문가 폭이 1856, 3712로 256의 배수가 아니어서, 모든 IQ2 단계가 실제로는 동일한 4.58 bpw 파일로 저장됐다. 이는 업로드자의 실수가 아닌 도구 자체의 동작 방식에 기인한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.