Qwen3.6-27B 처리량 2배
Luce DFlash: Qwen3.6-27B at up to 2x throughput on a single RTX 3090
·2026.04.28 01:31
핵심 내용
Luce DFlash가 단일 RTX 3090에서 Qwen3.6-27B 처리량을 최대 2배로 끌어올렸다.
자세히 보기
Luce DFlash는 ggml 기반의 C++/CUDA 스택으로, 단일 24GB RTX 3090에서 Qwen3.6-27B를 구동한다.
- HumanEval / GSM8K / Math500 기준, autoregressive 대비 평균 1.98배 처리량을 제시했다.
- 재학습 없이 speculative decoding을 적용했고, 대응되는 Qwen3.6-DFlash draft는 z-lab이 2026-04-26에 공개한 학습 중 모델이라고 밝혔다.
- 타깃 가중치는 Q4_K_M GGUF 약 16GB, draft는 bf16 약 3.46GB로 로드한다.
- KV 캐시는 TQ3_0으로 압축해 약 3.5 bpv 수준으로 줄였고, 4096 슬롯 ring으로 256K 컨텍스트를 24GB 안에 넣도록 설계했다.
- 2048토큰을 넘는 프롬프트에서는 prefill ubatch를 16에서 192로 자동 확대하며, 긴 프롬프트에서 약 913 tok/s prefill을 제시했다.
- 실행은
cmake빌드 후 GGUF 모델과 draft를 내려받아scripts/run.py로 돌리는 방식이며, llama.cpp / vLLM / SGLang 없이 동작한다고 설명했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.