맥에서 16배 절약
16x KV cache reduction with Apple Silicon kernels for Qwen3.6 and Qwen3.5
·2026.04.19 09:49
핵심 내용
Mac용 Qwen 커스텀 커널로 KV cache를 최대 16배 압축했다.
1 / 2
자세히 보기
Mac 사용자용 Qwen3.6 / Qwen3.5 전용 커스텀 Apple Silicon kernels가 공개됐다.
핵심 효과는 KV cache 최대 16배 압축과, MLX 양자화 모델에서의 reasoning 개선이다.
- 최대 컨텍스트: T=262K까지 테스트
- 구현 방식: 상용 vLLM kernels를 MLX로 포팅한 버전
- 배포: 무료 공개
- 참고 자료: 상세 글, 설치 방법, 벤치마크와 PyPI 페이지가 함께 제공됨
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.