AI Briefing

13분 대기함정

Tried running LLMs locally to save API costs… ended up waiting 13 minutes for ONE response 🤡

·2026.04.10 05:21

핵심 내용

터미널은 빠른데 앱에 붙이면 13분씩 걸리는 로컬 LLM의 함정이 드러났다.

자세히 보기

직접 Ollama 터미널에 치면 빠른데, 앱에 붙이는 순간 응답이 13분까지 늘어났다.

핵심 원인은 단순 모델 성능보다도 숨은 시스템 프롬프트, MCP/도구 오버헤드, 컨텍스트 크기, GPU 사용 여부에 있었다.

  • Claude Code/Codex류 도구는 20K~21K 토큰 수준의 시스템 프롬프트를 얹을 수 있어, 첫 요청부터 이미 무거워진다.
  • 노트북 환경에서는 내장 GPU(iGPU) 나 CPU/공유 메모리로 돌면 로컬 LLM이 급격히 느려진다.
  • 댓글에서는 ollama ps로 GPU 사용 여부를 확인하고, VRAM에 맞는 더 작은 모델을 쓰거나 ROCm/Vulkan 같은 가속 경로를 시도하라고 조언했다.
  • 실사용 경험담도 많았고, 일부는 로컬 LLM을 포기하고 API(예: DeepSeek) 로 돌아가는 선택을 했다.

결국 이 사례는 “로컬 LLM이 느리다”가 아니라, 앱 통합 방식과 하드웨어가 속도를 결정한다는 점을 보여준다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.