GLM-5.3-Flash-GGUF: 320B 파라미터, 활성 18B로 GLM-5.3-Flash를 로컬에서
unsloth/GLM-5.3-Flash-GGUF
·2026.08.27 14:10
프로젝트 소개
GLM-5 시리즈 최초의 네이티브 멀티모달 모델인 GLM-5.3-Flash를 로컬 환경에서 실행할 수 있게 해주는 GGUF 양자화 버전이다. Unsloth Dynamic 3.0 양자화 방식을 적용해 기존 방식 대비 높은 정확도를 유지하면서 메모리 효율성을 개선했다.

전체 파라미터는 320B이지만 실제로 활성화되는 파라미터는 18B에 불과하다. 이를 통해 GLM-5.2보다 뛰어난 성능을 내면서도 비용은 10분의 1 수준으로 낮췄다. 코딩 및 에이전트 벤치마크에서는 Claude Opus 4.8에 근접한 결과를 보인다.
기존 GLM 시리즈와 달리 스파스 어텐션과 리니어 어텐션을 결합한 하이브리드 아키텍처를 채택했다. 이 구조는 긴 컨텍스트 처리 시 서빙 비용을 크게 줄이면서도 정밀한 장기 기억 능력을 보존한다. 또한 Manifold-Constrained Hyper-Connections(mHC)를 도입해 확장 효율성을 높였다.
vLLM, SGLang, Docker Model Runner 등 주요 추론 프레임워크와 호환되어 OpenAI 호환 API를 통해 쉽게 호출할 수 있다. MIT 라이선스로 배포되어 상용 프로젝트에도 자유롭게 활용할 수 있다.
HuggingFace 모델
unsloth/GLM-5.3-Flash-GGUF
원문에 등록된 설명이 없습니다.
text-generation
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.