Mac용 LLM 서버 oMLX 공개, SSD 캐시로 지연 90초→5초
oMLX
·2026.08.30 05:17
핵심 내용
Mac용 네이티브 LLM 추론 서버 oMLX가 공개되어 SSD 기반 KV 캐시로 에이전트 대기 시간을 5초까지 단축했다.
1 / 5
자세히 보기
Mac 환경에서 실행되는 네이티브 LLM 추론 서버 oMLX가 공개되었습니다. 이 프로젝트는 Electron이 아닌 Swift 기반으로 개발되었으며, Apache 2.0 라이선스를 따르는 오픈소스입니다.
주요 성능 개선 및 특징
oMLX의 핵심 기술은 RAM과 SSD를 계층화한 KV 캐시입니다. 기존 로컬 모델 사용 시 에이전트 루프에서 전체 대화가 재계산되어 발생하던 90초의 지연 문제를 해결했습니다. KV 캐시가 SSD에 저장되므로 재시작 후에도 컨텍스트가 유지되며, 이를 통해 응답 대기 시간을 약 5초로 단축했습니다.
- 지원 모델: Text, Vision, OCR, Embedding, Reranker
- API 호환성: OpenAI 및 Anthropic API와 호환되어 기존 코드에 즉시 적용 가능
- 데이터 보안: 모든 연산이 로컬 머신에서 수행되어 외부 유출 위험 없음
운영 시 고려사항
중간 크기 모델로 긴 에이전트 세션을 운영할 경우 GB 단위의 SSD 용량이 필요할 수 있습니다. 여러 모델을 동시에 로드할 때는 메모리와 디스크 리소스 관리가 중요하며, 캐시 무결성(모델 해시 및 컨텍스트 키)에 대한 주의가 필요합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.