AI Briefing

Ollama Cloud 벤치마크

Ollama Cloud reliability + speed: 36-call bench across DeepSeek v3.2 → v4-pro → v4-flash + GLM-5.1

·2026.04.28 07:45

핵심 내용

36회 테스트에서 v4-flash가 무중단, v4-pro는 가장 느렸다.

자세히 보기

의료 추론용 3개 프롬프트를 대상으로 deepseek-v3.2:cloud, deepseek-v4-pro:cloud, deepseek-v4-flash:cloud, glm-5.1:cloud를 비교했다.

  • 각 조합을 3회씩 실행해 총 36회를 측정했다.
  • 설정은 temp=0.3, top_p=0.9, max_tokens=2000였고, /api/generate를 로컬 Ollama 게이트웨이로 호출했다.
  • 트랜지언트 에러에는 1회 자동 재시도(5초 지연) 를 넣었다.

성능은 모델별 편차가 컸다.

  • deepseek-v4-pro:cloud: 평균 124.8초로 가장 느렸지만, 평균 토큰 수는 3,149로 가장 많았다.
  • deepseek-v4-flash:cloud: 평균 67.7초, hard fail 0, silent retries 0으로 가장 안정적이었다.
  • deepseek-v3.2:cloud: 평균 55.1초, hard fail 1회와 silent retry 2회를 기록했다.
  • glm-5.1:cloud: 평균 101.8초, 처리량은 53.8 tok/s로 가장 높았지만 hard fail 1회를 기록했다.

전체적으로 36회 중 6회(17%) 에서 Ollama Cloud의 일시적 문제가 발생했다.

  • 3회는 HTTP 500이었고 1회 재시도로 복구됐다.
  • 3회는 240초 타임아웃까지 갔으며 재시도도 실패했다.

토큰 처리량은 클라우드 엔드포인트 제약 때문에 Ollama의 total_duration 기준으로 계산됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.