Apple Silicon용 MTP 추론 엔진 MTPLX
MTPLX | 2.24x faster TPS | The native MTP inference engine for Apple Silicon
·2026.05.05 09:31
Apple Silicon에서 MTP 헤드를 활용해 LLM 추론 속도를 최대 2.24배 높이는 MTPLX 엔진이 공개되었다.
MTPLX는 모델의 내장 MTP(Multi-Token Prediction) 헤드를 스펙큘레이티브 드래프터(speculative drafter)로 사용하여 Apple Silicon 환경에서 LLM 디코딩 속도를 최대 2.25배까지 향상시키는 추론 엔진이다.
주요 특징은 다음과 같다:
- 내장 MTP 활용: 별도의 외부 드래프터 모델이나 추가 메모리 없이, 모델이 자체적으로 보유한 MTP 헤드를 사용하여 효율성을 극대화한다.
- 정확한 샘플링: 기존의 그리디(greedy) 방식과 달리, **리젝션 샘플링(rejection sampling)**을 통해 수학적으로 정확한 온도(temperature) 샘플링을 지원하여 코딩 및 창의적 글쓰기 작업에 적합하다.
- 커스텀 Metal 커널: 패치된 MLX 포크와 커스텀 Metal 커널, 컴파일된 검증 그래프 등을 통해 최적화되었다.
- 완전한 서비스 스택: OpenAI 및 Anthropic 호환 API 서버, 브라우저 채팅 UI, 터미널 채팅 및 벤치마킹 도구를 제공한다.
실제 테스트 결과, MacBook Pro M5 Max에서 Qwen 3.6 27B 모델을 실행했을 때 초당 토큰 수(TPS)가 28 tok/s에서 63 tok/s로 약 2.24배 증가했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.