AI Briefing

Z.ai, GLM-5.3-Flash 공개: 18B 활성 파라미터로 Claude Opus 4.8에 근접

·2026.08.27 09:00

핵심 내용

Z.ai가 18B 활성 파라미터의 GLM-5.3-Flash를 공개하며 10분의 1 비용으로 Claude Opus 4.8에 근접한 성능을 달성했다.

1 / 4

자세히 보기

Z.ai는 GLM-5 시리즈 최초의 네이티브 멀티모달 모델인 GLM-5.3-Flash를 공개했다. 총 320B 파라미터 중 18B만 활성화되는 구조로, 기존 GLM-5.2보다 벤치마크와 실사용 워크로드에서 우수한 성능을 보여주면서도 가격은 10분의 1 수준이다. 코딩 및 에이전틱 벤치마크에서는 Claude Opus 4.8에 근접한 결과를 기록했다.

효율적인 아키텍처

GLM-5.3-Flash는 스파이스와 선형 어텐션을 결합한 하이브리드 아키텍처를 도입해 장문 컨텍스트 서빙 비용을 크게 줄였다. 또한 **Manifold-Constrained Hyper-Connections(mHC)**를 적용해 스케일링 효율을 높였다. GLM-4.5 시리즈와 비교할 때 총 파라미터 수는 비슷하지만(320B vs 355B), 활성화 파라미터(18B vs 32B)와 레이어 수(45 vs 92)를 거의 절반으로 줄여 초저비용 추론에 최적화했다.

성능 및 비용 경쟁력

Artificial Analysis Intelligence Index v4.1.1에서 57점을 기록하며, 이전에는 약 10배의 비용이 드는 지능 수준을 1개당 $0.045(할인 적용)에 제공한다. 코딩 및 에이전틱 6개 벤치마크에서 GLM-5.2를 일관되게 상회했으며, 특히 DeepSWE v1.1에서는 63.4점(46.2점 대비), AutomationBench에서는 48.8점(26.2점 대비)으로 큰 격차를 보였다.

사전 테스트 및 인프라

출시 전 ox-alpha라는 익명 이름으로 OpenCode와 OpenRouter에서 테스트되었으며, 해당 트래픽은 모두 중국산 AI 칩으로 처리되었다. 1M 토큰 컨텍스트 길이를 지원하기 위해 인덱서 지연 및 메모리 오버헤드를 줄이는 IndexPool 기술을 도입했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.