AI Briefing

Cloudflare의 AI Platform: agents를 위한 inference layer

·2026.04.16 23:05

핵심 내용

Cloudflare가 멀티모델 AI 게이트웨이와 BYOM 지원을 통합했다.

자세히 보기

Cloudflare가 AI Gateway와 Workers AI를 묶어, 여러 공급자의 모델을 하나의 unified inference layer로 쓰게 하겠다고 밝혔다.

  • Workers에서 AI.run() 하나로 OpenAI, Anthropic 등의 서드파티 모델을 호출할 수 있다.
  • 곧 REST API도 제공해, Workers 밖의 환경에서도 같은 모델 카탈로그를 쓸 수 있게 한다.
  • 현재 70+ models, 12+ providers를 하나의 API와 하나의 크레딧 체계로 제공한다.

운영 관점에서는 비용 가시성과 관측성을 강화한다. 요청에 커스텀 metadata를 넣어, 팀/사용자/워크플로별로 AI 지출을 분해해 볼 수 있다. 여러 모델과 공급자를 섞어 쓰는 환경에서 중앙화된 비용 관리가 핵심이라는 메시지다.

또한 Bring Your Own Model 방향도 제시했다. Replicate의 Cog를 이용해 모델 의존성과 추론 코드를 패키징하고, 이를 Workers AI에 배포해 자체 모델을 서빙할 수 있게 할 계획이다. 향후에는 고객용 API, wrangler 명령, GPU snapshotting 기반의 더 빠른 cold start도 예고했다.

agents에 중요한 성능 포인트로는 time to first token을 강조했다. Cloudflare는 전 세계 330개 도시에 있는 엣지 네트워크를 활용해 사용자와 추론 엔드포인트 사이의 네트워크 지연을 줄이고, Cloudflare-hosted 모델은 같은 글로벌 네트워크 안에서 실행돼 추가적인 public Internet hop이 없다.

신뢰성 측면에서는 automatic failover와 스트리밍 복원 기능을 제공한다. 다중 공급자 모델에서 한쪽이 장애를 내면 다른 제공자로 자동 라우팅하고, 긴 에이전트 작업 중 연결이 끊겨도 AI Gateway가 스트림을 버퍼링해 재연결 후 이어받을 수 있다. Agents SDK의 checkpointing과 결합하면 중단 체감이 줄어든다.

마지막으로 Replicate 팀이 Cloudflare AI Platform 팀에 합류했으며, Replicate 모델을 AI Gateway로 가져오고 hosted model을 Cloudflare 인프라로 재플랫폼하는 통합 작업이 진행 중이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.