GLM-5.3-Flash, 10만 개 이상 중국산 가속기 클러스터 추론 인프라 자체 구축… 성능 약 3배 향상
핵심 내용
GLM-5.3 기반 Infra Agent가 10만 개 이상의 중국산 가속기 클러스터에서 GLM-5.3-Flash 추론 인프라를 2주 미만 만에 구축해 엔드투엔드 서빙 성능을 약 3배 높였다.
자세히 보기
GLM-5.3-Flash의 자체 인프라 구축 성과
GLM-5.3 기반 Infra Agent가 10만 개 이상의 중국산 AI 가속기 클러스터에서 GLM-5.3-Flash의 프로덕션 추론 서비스를 구축했다. 제한된 메모리 환경에서 Intra-node tensor parallelism, ReplaySSM, W8A8 양자화, INT8/FP8/BF16 혼합 정밀도 캐시 양자화, Layer Split, 그리고 Encode-Prefill-Decode(EPD) 분산 아키텍처 등을 적용해 엔드투엔드 서빙 성능을 약 3배 향상시켰다. 하드웨어 효율과 토큰당 비용은 주류 NVIDIA GPU와 유사한 수준에 도달했으며, 초기 모델 적응부터 프로덕션 준비까지 2주 미만이 소요되었다.
최적화 기술 학습 및 적용
Infra Agent는 기존 커널에서 최적화 기술을 학습하여 'Optimization Skeletons'를 추출하고, 이를 바탕으로 새로운 커널의 타일링, 메모리 접근, 자원 할당 전략을 재평가했다. 예를 들어, KDA Decode 커널에서는 중복 계산을 제거하고 단일 스레드 블록으로 병합하는 방식으로 병렬성을 일부 희생하여 v2 대비 1.71배의 가속을 달성했다. 이러한 검증된 변경 사항과 적용 조건은 다시 스켈레톤 라이브러리에 반영되어 다음 최적화 주기의 공수를 줄이는 데 기여했다.
인간과 에이전트의 역할 분담
엔지니어는 최적화 목표와 시스템 경계를 설정하고, 수치적 의미나 동시성 동작, 프로덕션 리스크와 관련된 중요한 변경 사항을 검토하는 책임을 유지한다. Infra Agent는 분석, 가설 수립, 코드 변경 및 실험을 수행한다. 이 구조는 완전한 재귀적 자기 개선(RSI)에는 미치지 못하지만, 모델이 피드백을 수신하고 행동을 수정하는 에이전트 엔지니어링 루프를 통해 시스템 성능을 지속해서 강화함을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.