GLM-5.2를 위한 초고속 API 구축 방법 (5분 읽기)
·2026.07.27 09:00
Baseten이 지연 시간을 최소화하여 성능을 극대화한 GLM-5.2 전용 초고속 API를 출시했다.
Baseten은 GLM-5.2 모델을 위해 초당 최대 280 토큰, 평균 100 토큰의 속도를 구현한 세계에서 가장 빠른 API를 구축했다. 최근 성능 최적화를 통해 기존 출시일 대비 2배 이상의 성능 향상을 달려냈으며, 이는 Artificial Analysis 벤치마크를 통해 입증되었다.
새롭게 출시된 GLM-5.2-Fast API는 코딩 및 에이전트 활용 시 지연 시간을 줄이는 데 집중했다. 이를 위해 다음과 같은 기술적 최적화를 적용했다.
- 병렬 처리 방식 변경: 일반 API가 처리량(Throughput)을 위해 **ADP(Attention Data Parallelism)**를 사용하는 것과 달리, Fast API는 지연 시간 최적화를 위해 Tensor 및 Expert Parallelism만을 사용한다.
- 배치 크기 축소: 최대 배치 크기를 대폭 줄여 요청 간의 자원 경쟁을 최소화했다.
이 Fast API는 일반 API와 동일한 NVIDIA B200 GPU에서 구동되지만, 지연 시간 단축을 위해 처리량을 희생한 만큼 토큰 가격은 50% 더 높게 책정되었다. Baseten은 향후 Speculative Decoding 알고리즘을 추가 개선하여 성능을 더욱 높일 계획이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.