Qwen3.8-27B-DFlash2: Qwen3.8-27B 추론 속도 3.4배 끌어올리는 DFlash 2
z-lab/Qwen3.8-27B-DFlash2
프로젝트 소개
Qwen3.8-27B 모델의 추론 속도를 높이기 위해 설계된 DFlash 2 드래프트 모델이다. 단독으로 동작하지 않으며, SGLang이나 vLLM 같은 추론 서버 안에서 스펙ulative decoding의 보조 역할을 맡는다. 타겟 모델이 검증할 토큰을 미리 작성해 주는 구조다.

블록 디퓨션 방식의 드래프터로, 한 번에 토큰 블록 전체를 예측한다. 백본에 두 탭 동적 합성을 적용해 블록 후반부로 갈수록 드래프트 품질이 떨어지는 현상을 막는다. 그리디 출력은 타겟 모델과 정확히 일치하며, 샘플링 시 분포도 보존하는 손실 없는(decoding) 방식이다.
NVIDIA H200 단일 GPU 환경에서 SGLang을 이용해 측정한 결과, 오토레그레시브 디코딩 대비 최대 3.43배의 처리량 향상을 기록했다. Qwen3.8 내장 MTP나 커뮤니티 DSpark 드래프터보다 높은 수치를 보인다. GSM8K, MATH-500, HumanEval 등 다양한 벤치마크에서 일관된 성능 개선을 확인했다.
Apache-2.0 라이선스로 공개되어 있으며, 2B 파라미터 규모의 BF16 모델이다. Qwen3.8-27B를 서비스하는 환경에서 응답 지연 시간을 줄이고 싶을 때 적용할 수 있다. 기존 추론 서버 설정에 드래프트 모델 경로만 지정하면 바로 사용할 수 있다.
z-lab/Qwen3.8-27B-DFlash2
원문에 등록된 설명이 없습니다.
text-generation
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.