AI Briefing

2080 SUPER서 Qwen3.5 DFlash 구동

Got DFlash speculative decoding working on Qwen3.5-35B-A3B with an RTX 2080 SUPER 8GB

·2026.05.01 20:49

RTX 2080 SUPER 8GB에서 Qwen3.5-35B-A3B의 DFlash 구동이 확인됐다.

llama.cpp의 DFlash speculative decodingRTX 2080 SUPER 8GB에서 Qwen3.5-35B-A3B 조합으로 돌린 사례다. 대상 모델은 Q5_K_M, 드래프트 모델은 Q4_K_M이며, CUDA 백엔드와 DFlash PR 기준 빌드(67cb0d507 (8942))로 테스트했다.

메인 모델 GGUF는 약 24.44 GiB라 8GB VRAM에 직접 올릴 수 없었고, MoE expert CPU offload와 DFlash를 함께 사용했다. 일반 비-DFlash 설정의 최고 속도는 약 26.8 tok/s였고, 이때 최적값은 -ncmoe 32였다.

DFlash를 켜면 드래프트 모델도 VRAM을 쓰기 때문에 최적 -ncmoe34로 이동했다. 드래프트 모델은 약 267.8 MiB, 474M 파라미터 규모다.

재현용 테스트는 다음 핵심 설정으로 수행됐다.

  • --dflash
  • --draft-max 6
  • -cd 512 -c 4096
  • --temp 0 --top-k 1 --seed 42
  • -ngl 999 -ngld 99 -ncmoe 34

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.