AI Briefing

맥에서 35B 실사용

Coding on your local Mac with Qwen 3.6 & Native MLX engine SwiftLM

·2026.04.18 01:38

핵심 내용

SwiftLM이 24GB Mac에서 35B Qwen 모델을 40K~100K 컨텍스트로 구동한 결과를 제시했다.

자세히 보기

로컬 Mac용 SwiftLM에서 Qwen 3.6 35B를 100K 컨텍스트까지 돌린 벤치마크를 공개했다.

24GB Mac에서는 NVMe SSD에서 레이어 가중치를 스트리밍하고 TurboQuant KV cache 압축을 적용해 40K 컨텍스트에서 23.2GB 풋프린트로 35B dense 모델을 메모리 안에 넣었다.

대신 장문 컨텍스트에서는 속도가 떨어져 2.5 tok/s 수준까지 내려갔고, 여기에 0.8B speculative draft decoder를 붙이자 7.4 tok/s로 약 3배 회복했다고 밝혔다.

또한 M5 Pro에서 100K 컨텍스트를 네이티브로 매핑하면 63.9GB가 필요하지만, SSD 스트리밍과 TurboQuant 조합으로 요구 메모리를 약 60% 줄여 28.3GB 로드를 달성했다고 설명했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.