AI Briefing

AI Gateway를 통해 실시간 모델 성능 지표 확인 가능

·2026.01.26 22:00

Vercel AI Gateway가 수백 개의 모델에 대한 실시간 처리량과 지연 시간 지표를 제공한다.

AI Gateway가 수백 개의 모델에 대한 실시간 처리량(throughput)지연 시간(latency) 지표를 제공하기 시작했다. 사용자는 실제 성능 데이터를 기반으로 프로젝트에 가장 적합한 모델을 선택할 수 있다.

지표는 다음 세 가지 경로를 통해 매시간 업데이트된다:

  • 모델 리스트: 각 모델의 최적 성능(P50 지연 시간 및 처리량) 표시
  • 모델 상세 페이지: 동일 모델에 대한 제공업체(provider)별 성능 분석
  • REST API: 롤링 엔드포인트 성능 집계 데이터(P50/P95 지연 시간 및 처리량) 제공

모델 리스트에서는 처리량이나 지연 시간을 기준으로 정렬하여 가장 빠른 토큰 생성 모델이나 **TTFT(Time-to-First-Token)**가 가장 짧은 모델을 쉽게 찾을 수 있다. 또한, 상세 페이지를 통해 동일한 모델을 제공하는 여러 업체 간의 성능을 비교할 수 있다.

이러한 지표는 REST API를 통해 프로그래밍 방식으로도 호출할 수 있어, 자동화된 환경에서도 실시간 성능 데이터를 활용할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.