AI Briefing

H100 3GB 절약

Unweight: how we compressed an LLM 22% without sacrificing quality

·2026.04.19 18:06

핵심 내용

Unweight로 LLM 가중치 15~22%를 줄여 H100에서 약 3GB VRAM을 확보했다.

자세히 보기

Cloudflare가 Unweight를 공개했다. 목표는 비트 단위로 동일한 출력을 유지하면서 LLM 가중치를 더 작게 만들어, H100 기반 추론에서 메모리 대역폭 병목을 줄이는 것이다.

핵심은 BF16의 exponent byte만 Huffman coding으로 압축하는 방식이다. sign과 mantissa는 그대로 두고, 분포가 매우 치우친 exponent만 줄여서 약 30%의 MLP 가중치 압축을 달성했다. 이 방식은 gate / up / down projection 같은 MLP 계층에 선택적으로 적용된다.

실제 결과로는 Llama-3.1-8B 기준 전체 모델 크기 15~22% 감소, 약 3GB VRAM 절감이 보고됐다. Cloudflare는 이를 통해 같은 GPU에 더 많은 모델을 올리고, 추론 비용과 지연을 줄일 수 있다고 설명한다.

실행 경로는 워크로드에 따라 네 가지로 나뉜다.

  • full Huffman decode + cuBLAS
  • exponent-only decode
  • palette transcode
  • direct palette

작은 배치에서는 cuBLAS 경로가 유리하고, 큰 배치에서는 reconstructive matmul과 더 가벼운 전처리 경로가 유리하다. 그래서 런타임이 batch size와 weight matrix별로 autotuning을 수행해 최적 조합을 고른다.

이 글과 함께 기술 논문과 GPU kernels도 오픈소스로 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.