AI 모델 라우팅을 위한 통합 API
·2026.08.05 09:00
Google Cloud API Gateway가 OpenAI 호환 요청을 여러 LLM으로 동적 라우팅한다.
Google Cloud API Gateway가 Public Preview로 AI 모델 라우팅 기능을 제공한다. 개발자는 엔드포인트를 코드에 고정하거나 오픈소스 프록시를 직접 관리하지 않고도 OpenAI 호환 요청을 Gemini, Claude, OpenAI OSS-GPT로 보낼 수 있다.
API Gateway는 서버리스 인그레스 계층으로 단독 사용 시 간단한 속도 제한과 토큰 추적을 지원한다. Gemini Enterprise Agent Platform과 연동하면 Agent Gateway에서 에이전트의 외부 요청을 보안 정책으로 관리한 뒤 API Gateway에서 Google 호스팅 LLM으로 동적 라우팅할 수 있다.
라우팅 설정은 다음 단계로 구성된다.
- OpenAPI 3.x 명세의
x-google-api-management확장 블록에서 백엔드와 가상 모델 이름을 정의한다. x-google-model-router를 사용해 기본 모델과 대체 모델 간 라우팅 규칙을 지정한다.- 업데이트한 API 구성을 배포한다.
- 애플리케이션은 표준 OpenAI
POST요청을 보내고, Gateway가 백엔드의 네이티브 스키마로 변환해 요청을 전달한다.
하나의 라우터에서 참조하는 모든 백엔드는 동일한 호스트를 사용해야 한다. 라우팅은 공유 Vertex AI 호스트에서 모델과 경로를 변경하는 방식이며, 서로 다른 호스트 간 트래픽 라우팅은 지원하지 않는다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.