AI Briefing

Qwen3.6-27B 처리량 2배

Luce DFlash: Qwen3.6-27B at up to 2x throughput on a single RTX 3090

·2026.04.28 01:31

핵심 내용

Luce DFlash가 단일 RTX 3090에서 Qwen3.6-27B 처리량을 최대 2배로 끌어올렸다.

자세히 보기

Luce DFlash는 ggml 기반의 C++/CUDA 스택으로, 단일 24GB RTX 3090에서 Qwen3.6-27B를 구동한다.

  • HumanEval / GSM8K / Math500 기준, autoregressive 대비 평균 1.98배 처리량을 제시했다.
  • 재학습 없이 speculative decoding을 적용했고, 대응되는 Qwen3.6-DFlash draft는 z-lab이 2026-04-26에 공개한 학습 중 모델이라고 밝혔다.
  • 타깃 가중치는 Q4_K_M GGUF 약 16GB, draft는 bf16 약 3.46GB로 로드한다.
  • KV 캐시는 TQ3_0으로 압축해 약 3.5 bpv 수준으로 줄였고, 4096 슬롯 ring으로 256K 컨텍스트를 24GB 안에 넣도록 설계했다.
  • 2048토큰을 넘는 프롬프트에서는 prefill ubatch를 16에서 192로 자동 확대하며, 긴 프롬프트에서 약 913 tok/s prefill을 제시했다.
  • 실행은 cmake 빌드 후 GGUF 모델과 draft를 내려받아 scripts/run.py로 돌리는 방식이며, llama.cpp / vLLM / SGLang 없이 동작한다고 설명했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.