Zai, GLM-5.1 추론 네트워크 최적화
Zai replaced the network architecture running GLM-5.1 inference and the gains are pretty wild
핵심 내용
Zai가 ZCube 아키텍처 도입을 통해 GLM-5.1 추론 인프라의 비용을 33% 절감하고 처리량을 15% 높였다.
자세히 보기
Zai가 Tsinghua University 및 HarnetsAI와 공동 개발한 ZCube 아키텍처를 1,000개 GPU 클러스터에 도입하여 GLM-5.1 추론 성능을 크게 개선했다.
기존 ROFT 설정을 ZCube로 교체한 결과, 동일한 GPU와 소프트웨어 스택 환경에서 다음과 같은 성과를 달성했다:
- 스위치 및 광 모듈 비용 33% 절감
- GPU 추론 처리량(Throughput) 15% 향상
- 첫 토큰 P99 테일 레이턴시(Tail Latency) 40.6% 감소
이번 개선의 핵심은 Prefill-Decode(PD) 분리 추론(Disaggregated Inference) 시 발생하는 비대칭 트래픽 문제를 해결한 것이다. 기존 ROFT 토폴로지는 학습 워크로드에는 적합하지만, PD 분리 추론 시 트래픽 패턴이 정적 레일 매핑과 일치하지 않아 특정 Leaf 스위치에 병목 현상과 PFC 백프레셔가 발생한다.
ZCube는 Spine 레이어를 완전히 제거하고 두 스위치 그룹 간의 **완전 이분 인터커넥트(Complete Bipartite Interconnect)**를 사용하는 플래튼(Flattened) 구조를 채택했다. 이를 통해 ROFT 설계상 피할 수 없었던 네트워크 혼잡 문제를 근본적으로 해결하며 비용 절감과 성능 향상을 동시에 달성했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.