AI Briefing

Apple, MLX LM Server 공개

New MLX LM Server From Apple

·2026.06.09 09:28

Apple이 연속 배치(Continuous Batching)와 분산 추론을 지원하는 MLX LM Server를 출시했다.

Apple의 MLX LM Server는 Apple Silicon 하드웨어에 최적화된 새로운 모델 서빙 도구입니다.

주요 기술적 특징은 다음과 같습니다:

  • 성능 최적화: M-시리즈 칩의 Neural Engine을 활용하여 프롬프트 처리 속도를 대폭 향상시켰습니다.
  • 병렬 처리: Continuous Batching 기술을 적용하여 여러 에이전트의 요청을 중단 없이 동시에 처리할 수 있습니다.
  • 확장성: Thunderbolt RDMA를 통한 분산 추론을 지원하여, 단일 기기의 메모리를 초과하는 대규모 모델도 여러 Mac에 걸쳐 구동할 수 있습니다.

개발자는 pip를 통해 간편하게 설치할 수 있으며, 로컬 서버 주소를 에이전트 도구에 연결하여 즉시 사용할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.