ZCube 도입으로 GLM-5.1 추론 최적화
Zai replaced the network architecture running GLM-5.1 inference and the gains are pretty wild
·2026.05.28 22:09
핵심 내용
Zai가 ZCube 네트워크 아키텍처를 도입해 GLM-5.1 추론 비용을 33% 줄이고 처리량을 15% 높였다.
자세히 보기
Zai가 1,000개의 GPU 클러스터에서 실행되는 GLM-5.1 코딩 추론을 위해 기존 ROFT 네트워크 구조를 ZCube로 업그레이드했다. ZCube는 칭화대학교 및 HarnetsAI와 공동 개발한 아키텍처다.
이번 업그레이드를 통해 다음과 같은 성과를 거두었다:
- 스위치 및 광학 모듈 비용 33% 절감
- GPU 추론 처리량(Throughput) 15% 증가
- 첫 토큰의 P99 테일 레이턴시(Tail Latency) 40.6% 감소
기존 ROFT 토폴로지는 학습 워크로드에는 적합하지만, Prefill-Decode(PD) 분리 추론(Disaggregated Inference) 환경에서는 비대칭적인 트래픽 패턴으로 인해 특정 리프 스위치에 병목 현상(Hotspots)과 PFC 백프레셔가 발생하는 문제가 있었다.
ZCube는 스파인(Spine) 계층을 완전히 제거하고 두 스위치 그룹 간의 완전 이분 그래프(Complete Bipartite Interconnect) 방식을 사용하는 플래튼(Flattened) 구조를 채택하여 이러한 혼잡 문제를 근본적으로 해결했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.