API 프롬프트 캐싱 도입
·2024.10.01 19:03
OpenAI가 반복되는 입력 토큰에 대해 50% 할인과 속도 향상을 제공하는 프롬프트 캐싱을 도입했다.
OpenAI가 개발자의 비용 절감과 지연 시간(latency) 단축을 위해 Prompt Caching을 도입했다. 코드 수정 작업이나 긴 대화처럼 동일한 컨텍스트를 반복 사용하는 경우, 최근 사용된 입력 토큰을 재사용하여 50% 할인된 가격과 더 빠른 처리 속도를 제공한다.
지원 대상 및 가격 정책은 다음과 같다:
- GPT-4o, GPT-4o mini, o1-preview, o1-mini 및 해당 모델의 파인튜닝 버전.
- 캐시된 입력 토큰은 미사용 토큰 대비 50% 저렴하게 제공된다. (예: GPT-4o 기준 $2.50 $\rightarrow$ $1.25)
캐싱은 1,024 토큰 이상의 프롬프트에 대해 자동으로 적용되며, 128토큰 단위로 가장 긴 접두사(prefix)를 캐싱한다. API 응답의 usage 필드 내 prompt_tokens_details.cached_tokens를 통해 캐시 사용량을 확인할 수 있다.
캐시는 비활성 상태가 5~10분 지속되면 삭제되기 시작하며, 최대 1시간 이내에 완전히 제거된다. 모든 캐시는 조직 간에 공유되지 않으며 OpenAI의 기업 프라이버시 정책을 준수한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.