ExLlamaV3 대규모 업데이트
ExLlamaV3 Major Updates!
·2026.05.11 16:05
ExLlamaV3가 Gemma 4 지원, DFlash 최적화, 버그 수정을 반영했다.
ExLlamaV3가 v0.0.29~v0.0.33에서 연속 업데이트를 내놨다. Gemma 4 지원, 캐시 효율 개선, DFlash 지원/양자화, 추가 버그 수정과 효율 개선이 이어졌다.
DFlash는 여러 워크로드에서 큰 폭의 속도 향상을 보였다.
- 코딩: 59.21 t/s → 177.67 t/s (3.00배)
- 에이전트형 코드: 55.98 t/s → 140.61 t/s (2.51배)
- 에이전트형 curl: 54.03 t/s → 125.94 t/s (2.33배)
- 번역: 58.11 t/s → 75.73 t/s (1.30배)
- 번역(reasoning): 58.08 t/s → 119.43 t/s (2.06배)
- 창작: 59.10 t/s → 89.19 t/s (1.50배)
또한 Qwen3.5, Trinity-Nano, Gemma4 계열의 4bit 전후 설정에 대한 3090·4090·5090·6000 Pro 측정치가 공개됐고, DFlash 모델 양자화와 추가 버그 수정, 후속 최적화가 dev 브랜치에서 계속 진행 중이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.