AI Gateway를 통해 실시간 모델 성능 지표 확인 가능
·2026.01.26 22:00
Vercel AI Gateway가 수백 개의 모델에 대한 실시간 처리량과 지연 시간 지표를 제공한다.
AI Gateway가 수백 개의 모델에 대한 실시간 처리량(throughput) 및 지연 시간(latency) 지표를 제공하기 시작했다. 사용자는 실제 성능 데이터를 기반으로 프로젝트에 가장 적합한 모델을 선택할 수 있다.
지표는 다음 세 가지 경로를 통해 매시간 업데이트된다:
- 모델 리스트: 각 모델의 최적 성능(P50 지연 시간 및 처리량) 표시
- 모델 상세 페이지: 동일 모델에 대한 제공업체(provider)별 성능 분석
- REST API: 롤링 엔드포인트 성능 집계 데이터(P50/P95 지연 시간 및 처리량) 제공
모델 리스트에서는 처리량이나 지연 시간을 기준으로 정렬하여 가장 빠른 토큰 생성 모델이나 **TTFT(Time-to-First-Token)**가 가장 짧은 모델을 쉽게 찾을 수 있다. 또한, 상세 페이지를 통해 동일한 모델을 제공하는 여러 업체 간의 성능을 비교할 수 있다.
이러한 지표는 REST API를 통해 프로그래밍 방식으로도 호출할 수 있어, 자동화된 환경에서도 실시간 성능 데이터를 활용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.