AI Briefing

Ollama 지연폭발

Ollama Cloud has become unbearably slow

·2026.04.15 23:46

핵심 내용

Ollama Cloud의 응답 지연과 낮은 TPS 때문에 구독 해지까지 나온 불만이다.

자세히 보기

Ollama Cloud의 추론 속도가 체감상 사용 불가 수준으로 느려졌다는 불만이 제기됐다.

실사용자가 여러 모델을 돌려 본 결과, 초당 토큰 생성 속도는 다음과 같았다.

  • GLM 5: 11 tok/s
  • GLM 5.1: 8 tok/s
  • Qwen 3.5: 14 tok/s
  • MiniMax 2.7: 22 tok/s

작성자는 단순한 작업도 1시간 이상 걸린다고 주장하며, 구독료를 내는 이유를 묻고 있다. 줄어든 사용 한도보다도 추론 속도 저하가 더 큰 문제라고 지적했고, 불만이 해소되지 않으면 구독을 취소하겠다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.