AI Briefing

llama.cpp, Qwen3.8 Metal 최적화

Custom llama.cpp branch with faster metal Qwen-3.8-Flash-Next inference and n-gram SSD offload.

·2026.08.28 07:42

핵심 내용

llama.cpp의 Metal 및 n-gram SSD 오프로드 최적화 브랜치가 공개되어 Apple Silicon에서 Qwen-3.8-Flash-Next 추론 성능을 개선했다.

자세히 보기

llama.cpp의 비공식 브랜치(metal-qwen4exp-split-ngram)가 Apple Silicon 환경에서 Qwen-3.8-Flash-Next 모델의 추론 성능을 최적화했다고 밝혔다. 이 브랜치는 Metal 백엔드 최적화와 함께 n-gram 텐서의 SSD 오프로드 기능을 지원하여, RAM과 VRAM 용량을 초과하는 높은 양자화 모델도 실행할 수 있도록 한다.

M1 Ultra 기반 벤치마크 결과, 128B 파라미터의 Q8_0 양자화 모델에서 프롬프트 처리(pp512)는 초당 530토큰, 토큰 생성(tg128)은 초당 31토큰 수준을 기록했다. 특히 긴 컨텍스트(d10000~30000)에서도 pp512 기준 초당 410~449토큰의 성능을 유지하며 효율적인 추론이 가능함을 확인했다.

SSD 오프로드 기능은 프롬프트 처리 속도에 상당한 성능 저하를 유발하지만, 토큰 생성 속도는 상대적으로 덜 영향을 받아 실사용이 가능하다. 이를 통해 하드웨어 메모리 한계를 넘어서는 대규모 모델 배포가 가능해진다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.