AI Briefing

맥에서 16배 절약

16x KV cache reduction with Apple Silicon kernels for Qwen3.6 and Qwen3.5

·2026.04.19 09:49

Mac용 Qwen 커스텀 커널로 KV cache를 최대 16배 압축했다.

Mac 사용자용 Qwen3.6 / Qwen3.5 전용 커스텀 Apple Silicon kernels가 공개됐다.

핵심 효과는 KV cache 최대 16배 압축과, MLX 양자화 모델에서의 reasoning 개선이다.

  • 최대 컨텍스트: T=262K까지 테스트
  • 구현 방식: 상용 vLLM kernelsMLX로 포팅한 버전
  • 배포: 무료 공개
  • 참고 자료: 상세 글, 설치 방법, 벤치마크와 PyPI 페이지가 함께 제공됨

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.