Gemma 4용 DFlash 공개
z-lab released gemma-4-26B-A4B-it-DFlash. Anybody tried it yet?
·2026.05.08 23:18
z-lab이 Gemma 4용 DFlash drafter 모델과 논문을 공개했다.
z-lab이 gemma-4-26B-A4B-it-DFlash를 공개했다. 이 모델은 block diffusion 기반의 speculative decoding drafter로, 반드시 google/gemma-4-26B-A4B-it와 함께 사용해야 한다.
- 공개 자료: arXiv 논문, GitHub 저장소, 프로젝트 블로그, Hugging Face 모델 카드
- 서빙 지원: vLLM과 SGLang 연동 예시를 제공한다
- 성능 주장: B300 단일 GPU 환경에서 최대 3.7배 처리량 향상을 제시했다
- 측정 조건: thinking 활성화, greedy decoding, 최대 출력 길이 4096, concurrency 1/8/32 기준 벤치마크를 포함했다
벤치마크에서는 Math500, GSM8K, HumanEval, MBPP, MT-Bench에서 모두 AR 대비 더 높은 generated tokens/sec를 보였고, acceptance length도 태스크별로 함께 제시했다. vLLM에서는 아직 Gemma 4 DFlash 지원이 병합되지 않아 PR 기반 설치가 필요하며, SGLang도 실험적 옵션을 통해 실행할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.