RTX 3090에서 Qwen3.5-27B로 207 tok/s를 달성했다
·2026.04.21 03:46
RTX 3090에서 Qwen3.5-27B DFlash+DDTree로 최대 207 tok/s를 기록.
Lucebox가 RTX 3090에서 Qwen3.5-27B 추론 성능을 끌어올린 두 가지 구현을 공개했다.
- Megakernel Qwen3.5 0.8B: 24개 레이어를 하나의 CUDA dispatch로 묶은 persistent kernel로,
prefill pp520에서 37,800,decode tg128에서 413 tok/s, 1.87 tok/J를 기록했다. 비교 대상인 llama.cpp BF16은 11,247 / 267 tok/s, 0.76 tok/J였다. - DFlash DDTree Qwen3.5 27B GGUF: 단일 RTX 3090에서 Q4_K_M target + BF16 draft, budget=22 설정으로 동작하며, 데모에서 207.6 tok/s(AR 38.0 tok/s 대비 5.46x)를 냈다. HumanEval 평균은 129.5 tok/s, AR 대비 3.43x, chain speculative decoding 대비 15% 빠르다고 제시했다.
- 128K context도 24 GB 안에 넣기 위해 Q4_0 KV cache와 슬라이딩
target_featring을 사용했다. 이 구성에서는 131072 ctx에서 134.78 tok/s를 보였다. - 구현 측면에서는 ggml 위에 C++/CUDA decode engine을 새로 포팅했고, tree-aware SSM rollback용 커스텀 CUDA 커널 3개를 추가했다:
ggml_ssm_conv_tree,ggml_gated_delta_net_tree,ggml_gated_delta_net_tree_persist.
핵심은, 이 프로젝트가 단순한 감상문이 아니라 하드웨어, 모델, 양자화, 컨텍스트 길이, 벤치마크 수치까지 포함한 재현 가능한 성능 보고라는 점이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.