AI Briefing

Qwen3.6-27B 처리량 2배

Luce DFlash: Qwen3.6-27B at up to 2x throughput on a single RTX 3090

·2026.04.28 01:31

Luce DFlash가 단일 RTX 3090에서 Qwen3.6-27B 처리량을 최대 2배로 끌어올렸다.

Luce DFlash는 ggml 기반의 C++/CUDA 스택으로, 단일 24GB RTX 3090에서 Qwen3.6-27B를 구동한다.

  • HumanEval / GSM8K / Math500 기준, autoregressive 대비 평균 1.98배 처리량을 제시했다.
  • 재학습 없이 speculative decoding을 적용했고, 대응되는 Qwen3.6-DFlash draftz-lab2026-04-26에 공개한 학습 중 모델이라고 밝혔다.
  • 타깃 가중치는 Q4_K_M GGUF 약 16GB, draft는 bf163.46GB로 로드한다.
  • KV 캐시는 TQ3_0으로 압축해 약 3.5 bpv 수준으로 줄였고, 4096 슬롯 ring으로 256K 컨텍스트를 24GB 안에 넣도록 설계했다.
  • 2048토큰을 넘는 프롬프트에서는 prefill ubatch를 16에서 192로 자동 확대하며, 긴 프롬프트에서 약 913 tok/s prefill을 제시했다.
  • 실행은 cmake 빌드 후 GGUF 모델과 draft를 내려받아 scripts/run.py로 돌리는 방식이며, llama.cpp / vLLM / SGLang 없이 동작한다고 설명했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.