Qwen3.6-27B 처리량 2배
Luce DFlash: Qwen3.6-27B at up to 2x throughput on a single RTX 3090
·2026.04.28 01:31
Luce DFlash가 단일 RTX 3090에서 Qwen3.6-27B 처리량을 최대 2배로 끌어올렸다.
Luce DFlash는 ggml 기반의 C++/CUDA 스택으로, 단일 24GB RTX 3090에서 Qwen3.6-27B를 구동한다.
- HumanEval / GSM8K / Math500 기준, autoregressive 대비 평균 1.98배 처리량을 제시했다.
- 재학습 없이 speculative decoding을 적용했고, 대응되는 Qwen3.6-DFlash draft는 z-lab이 2026-04-26에 공개한 학습 중 모델이라고 밝혔다.
- 타깃 가중치는 Q4_K_M GGUF 약 16GB, draft는 bf16 약 3.46GB로 로드한다.
- KV 캐시는 TQ3_0으로 압축해 약 3.5 bpv 수준으로 줄였고, 4096 슬롯 ring으로 256K 컨텍스트를 24GB 안에 넣도록 설계했다.
- 2048토큰을 넘는 프롬프트에서는 prefill ubatch를 16에서 192로 자동 확대하며, 긴 프롬프트에서 약 913 tok/s prefill을 제시했다.
- 실행은
cmake빌드 후 GGUF 모델과 draft를 내려받아scripts/run.py로 돌리는 방식이며, llama.cpp / vLLM / SGLang 없이 동작한다고 설명했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.