Ollama 0.32.15 메타데이터 캐시
Ollama 0.32.15 adds a metadata cache; measure more than tokens per second
·2026.08.21 00:18
핵심 내용
Ollama 0.32.15가 메타데이터 캐시를 추가해 요청 처리 오버헤드를 줄였다.
자세히 보기
Ollama 0.32.15 프리릴리스 버전이 모델 메타데이터 캐시 기능을 도입하여 요청당 오버헤드를 감소시켰다. 해당 릴리스 노트에는 일반적인 지연 시간 벤치마크가 포함되어 있지 않아, 보편적인 속도 향상 수치를 제시할 수는 없다.
사용자가 체감하는 지연 시간은 토큰 생성 속도 외에도 큐잉, 요청 파싱, 모델 탐색, 메타데이터 조회, 로딩, 워밍업, 추론, 응답 전송 등 다양한 단계의 합산이다. 설정 작업이 매 요청마다 반복되면 모델이 빠르더라도 느리게 느껴질 수 있다.
로컬 스택의 성능을 측정할 때는 다음 세그먼트를 별도로 타이밍해야 한다.
- 요청 도착부터 디스패치까지
- 메타데이터 및 모델 조회
- 모델 로딩 또는 워밍업
- 첫 토큰 도달 시간 (TTFT)
- 생성 및 응답 완료
모델, 양자화, 프롬프트, 하드웨어, 동시성, 클라이언트 설정을 고정하고 콜드/웜 경로를 비교해야 하며, 캐시는 일부 구간만 단축시킬 수 있으므로 무효화 및 스테일 데이터 동작에 대한 별도 테스트도 필요하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.