AI Briefing

2080 SUPER서 Qwen3.5 DFlash 구동

Got DFlash speculative decoding working on Qwen3.5-35B-A3B with an RTX 2080 SUPER 8GB

·2026.05.01 20:49

핵심 내용

RTX 2080 SUPER 8GB에서 Qwen3.5-35B-A3B의 DFlash 구동이 확인됐다.

자세히 보기

llama.cpp의 DFlash speculative decoding을 RTX 2080 SUPER 8GB에서 Qwen3.5-35B-A3B 조합으로 돌린 사례다. 대상 모델은 Q5_K_M, 드래프트 모델은 Q4_K_M이며, CUDA 백엔드와 DFlash PR 기준 빌드(67cb0d507 (8942))로 테스트했다.

메인 모델 GGUF는 약 24.44 GiB라 8GB VRAM에 직접 올릴 수 없었고, MoE expert CPU offload와 DFlash를 함께 사용했다. 일반 비-DFlash 설정의 최고 속도는 약 26.8 tok/s였고, 이때 최적값은 -ncmoe 32였다.

DFlash를 켜면 드래프트 모델도 VRAM을 쓰기 때문에 최적 -ncmoe가 34로 이동했다. 드래프트 모델은 약 267.8 MiB, 474M 파라미터 규모다.

재현용 테스트는 다음 핵심 설정으로 수행됐다.

  • --dflash
  • --draft-max 6
  • -cd 512 -c 4096
  • --temp 0 --top-k 1 --seed 42
  • -ngl 999 -ngld 99 -ncmoe 34

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.