GLM-5.2를 위한 초고속 API 구축 방법 (5분 읽기)
·2026.07.27 09:00
핵심 내용
Baseten이 지연 시간을 최소화하여 성능을 극대화한 GLM-5.2 전용 초고속 API를 출시했다.
1 / 2
자세히 보기
Baseten은 GLM-5.2 모델을 위해 초당 최대 280 토큰, 평균 100 토큰의 속도를 구현한 세계에서 가장 빠른 API를 구축했다. 최근 성능 최적화를 통해 기존 출시일 대비 2배 이상의 성능 향상을 달려냈으며, 이는 Artificial Analysis 벤치마크를 통해 입증되었다.
새롭게 출시된 GLM-5.2-Fast API는 코딩 및 에이전트 활용 시 지연 시간을 줄이는 데 집중했다. 이를 위해 다음과 같은 기술적 최적화를 적용했다.
- 병렬 처리 방식 변경: 일반 API가 처리량(Throughput)을 위해 **ADP(Attention Data Parallelism)**를 사용하는 것과 달리, Fast API는 지연 시간 최적화를 위해 Tensor 및 Expert Parallelism만을 사용한다.
- 배치 크기 축소: 최대 배치 크기를 대폭 줄여 요청 간의 자원 경쟁을 최소화했다.
이 Fast API는 일반 API와 동일한 NVIDIA B200 GPU에서 구동되지만, 지연 시간 단축을 위해 처리량을 희생한 만큼 토큰 가격은 50% 더 높게 책정되었다. Baseten은 향후 Speculative Decoding 알고리즘을 추가 개선하여 성능을 더욱 높일 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.