AI Briefing

Gemini API의 비용과 신뢰성을 조절하는 새로운 방법

·2026.04.03 01:00

핵심 내용

Gemini API에 Flex와 Priority가 추가돼 비용과 신뢰성을 티어별로 조절할 수 있다.

자세히 보기

Gemini API에 두 가지 새로운 service tier, Flex와 Priority가 추가됐다. 하나의 unified interface에서 요청의 중요도에 따라 비용과 신뢰성을 세밀하게 조절할 수 있다.

AI가 단순 채팅을 넘어 복잡한 agent workflow로 확장되면서, 개발자는 보통 두 종류의 작업을 따로 다뤄야 했다. 대량의 background task는 즉시 응답이 필요 없고, interactive task는 높은 신뢰성과 빠른 응답이 중요하다. 그동안은 이런 차이를 맞추기 위해 standard synchronous serving과 Batch API를 나눠 써야 했지만, 새 티어는 그 간극을 메운다.

Flex Inference는 latency에 여유가 있는 작업을 위한 비용 최적화 티어다.

  • 50% 가격 절감: Standard API 대비 절반 가격으로 사용할 수 있다.
  • 동기식 호출: input/output 파일을 관리하거나 job 완료를 polling할 필요가 없다.
  • 적합한 용도: background CRM 업데이트, 대규모 research simulation, background에서 브라우징하거나 생각하는 agentic workflow.

Flex는 service_tier 파라미터만 설정하면 사용할 수 있으며, paid tier 전체와 GenerateContent, Interactions API 요청에 제공된다.

Priority Inference는 중요한 트래픽을 위한 최고 신뢰성 티어다. 피크 시간대에도 요청이 preempt되지 않도록 보장하는 데 초점을 맞춘다.

  • 최고 수준의 criticality: 중요한 요청에 더 높은 신뢰성을 제공한다.
  • 자동 graceful downgrade: Priority 한도를 넘으면 요청이 실패하지 않고 Standard tier로 자동 처리된다.
  • 응답 투명성: 어떤 tier가 요청을 처리했는지 API 응답에서 확인할 수 있다.
  • 적합한 용도: 실시간 고객 지원 bot, live content moderation pipeline, 시간 민감 요청.

Priority 역시 service_tier를 지정해 사용할 수 있다. 이 티어는 Tier 2 / 3 paid projects의 GenerateContent API와 Interactions API에서 제공되며, 자세한 가격은 Gemini API 문서와 cookbook 예제로 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.