2080 SUPER서 Qwen3.5 DFlash 구동
Got DFlash speculative decoding working on Qwen3.5-35B-A3B with an RTX 2080 SUPER 8GB
·2026.05.01 20:49
RTX 2080 SUPER 8GB에서 Qwen3.5-35B-A3B의 DFlash 구동이 확인됐다.
llama.cpp의 DFlash speculative decoding을 RTX 2080 SUPER 8GB에서 Qwen3.5-35B-A3B 조합으로 돌린 사례다. 대상 모델은 Q5_K_M, 드래프트 모델은 Q4_K_M이며, CUDA 백엔드와 DFlash PR 기준 빌드(67cb0d507 (8942))로 테스트했다.
메인 모델 GGUF는 약 24.44 GiB라 8GB VRAM에 직접 올릴 수 없었고, MoE expert CPU offload와 DFlash를 함께 사용했다. 일반 비-DFlash 설정의 최고 속도는 약 26.8 tok/s였고, 이때 최적값은 -ncmoe 32였다.
DFlash를 켜면 드래프트 모델도 VRAM을 쓰기 때문에 최적 -ncmoe가 34로 이동했다. 드래프트 모델은 약 267.8 MiB, 474M 파라미터 규모다.
재현용 테스트는 다음 핵심 설정으로 수행됐다.
--dflash--draft-max 6-cd 512 -c 4096--temp 0 --top-k 1 --seed 42-ngl 999 -ngld 99 -ncmoe 34
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.