AI Briefing

Zai, GLM-5.1 추론 네트워크 최적화

Zai replaced the network architecture running GLM-5.1 inference and the gains are pretty wild

·2026.05.28 22:09

Zai가 ZCube 아키텍처 도입을 통해 GLM-5.1 추론 인프라의 비용을 33% 절감하고 처리량을 15% 높였다.

Zai가 Tsinghua University 및 HarnetsAI와 공동 개발한 ZCube 아키텍처를 1,000개 GPU 클러스터에 도입하여 GLM-5.1 추론 성능을 크게 개선했다.

기존 ROFT 설정을 ZCube로 교체한 결과, 동일한 GPU와 소프트웨어 스택 환경에서 다음과 같은 성과를 달성했다:

  • 스위치 및 광 모듈 비용 33% 절감
  • GPU 추론 처리량(Throughput) 15% 향상
  • 첫 토큰 P99 테일 레이턴시(Tail Latency) 40.6% 감소

이번 개선의 핵심은 Prefill-Decode(PD) 분리 추론(Disaggregated Inference) 시 발생하는 비대칭 트래픽 문제를 해결한 것이다. 기존 ROFT 토폴로지는 학습 워크로드에는 적합하지만, PD 분리 추론 시 트래픽 패턴이 정적 레일 매핑과 일치하지 않아 특정 Leaf 스위치에 병목 현상과 PFC 백프레셔가 발생한다.

ZCube는 Spine 레이어를 완전히 제거하고 두 스위치 그룹 간의 **완전 이분 인터커넥트(Complete Bipartite Interconnect)**를 사용하는 플래튼(Flattened) 구조를 채택했다. 이를 통해 ROFT 설계상 피할 수 없었던 네트워크 혼잡 문제를 근본적으로 해결하며 비용 절감과 성능 향상을 동시에 달성했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.