AI Briefing

ZCube 도입으로 GLM-5.1 추론 최적화

Zai replaced the network architecture running GLM-5.1 inference and the gains are pretty wild

·2026.05.28 22:09

Zai가 ZCube 네트워크 아키텍처를 도입해 GLM-5.1 추론 비용을 33% 줄이고 처리량을 15% 높였다.

Zai가 1,000개의 GPU 클러스터에서 실행되는 GLM-5.1 코딩 추론을 위해 기존 ROFT 네트워크 구조를 ZCube로 업그레이드했다. ZCube는 칭화대학교 및 HarnetsAI와 공동 개발한 아키텍처다.

이번 업그레이드를 통해 다음과 같은 성과를 거두었다:

  • 스위치 및 광학 모듈 비용 33% 절감
  • GPU 추론 처리량(Throughput) 15% 증가
  • 첫 토큰의 P99 테일 레이턴시(Tail Latency) 40.6% 감소

기존 ROFT 토폴로지는 학습 워크로드에는 적합하지만, Prefill-Decode(PD) 분리 추론(Disaggregated Inference) 환경에서는 비대칭적인 트래픽 패턴으로 인해 특정 리프 스위치에 병목 현상(Hotspots)과 PFC 백프레셔가 발생하는 문제가 있었다.

ZCube는 스파인(Spine) 계층을 완전히 제거하고 두 스위치 그룹 간의 완전 이분 그래프(Complete Bipartite Interconnect) 방식을 사용하는 플래튼(Flattened) 구조를 채택하여 이러한 혼잡 문제를 근본적으로 해결했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.