Ollama Cloud 벤치마크
Ollama Cloud reliability + speed: 36-call bench across DeepSeek v3.2 → v4-pro → v4-flash + GLM-5.1
·2026.04.28 07:45
핵심 내용
36회 테스트에서 v4-flash가 무중단, v4-pro는 가장 느렸다.
자세히 보기
의료 추론용 3개 프롬프트를 대상으로 deepseek-v3.2:cloud, deepseek-v4-pro:cloud, deepseek-v4-flash:cloud, glm-5.1:cloud를 비교했다.
- 각 조합을 3회씩 실행해 총 36회를 측정했다.
- 설정은
temp=0.3,top_p=0.9,max_tokens=2000였고,/api/generate를 로컬 Ollama 게이트웨이로 호출했다. - 트랜지언트 에러에는 1회 자동 재시도(5초 지연) 를 넣었다.
성능은 모델별 편차가 컸다.
- deepseek-v4-pro:cloud: 평균 124.8초로 가장 느렸지만, 평균 토큰 수는 3,149로 가장 많았다.
- deepseek-v4-flash:cloud: 평균 67.7초, hard fail 0, silent retries 0으로 가장 안정적이었다.
- deepseek-v3.2:cloud: 평균 55.1초, hard fail 1회와 silent retry 2회를 기록했다.
- glm-5.1:cloud: 평균 101.8초, 처리량은 53.8 tok/s로 가장 높았지만 hard fail 1회를 기록했다.
전체적으로 36회 중 6회(17%) 에서 Ollama Cloud의 일시적 문제가 발생했다.
- 3회는 HTTP 500이었고 1회 재시도로 복구됐다.
- 3회는 240초 타임아웃까지 갔으며 재시도도 실패했다.
토큰 처리량은 클라우드 엔드포인트 제약 때문에 Ollama의 total_duration 기준으로 계산됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.