AI Briefing

ExLlamaV3 v1.0.0 정식 출시

ExLlamaV3 v1.0.0 - Major Performance Upgrades

·2026.07.15 16:17

ExLlamaV3 v1.0.0이 출시되어 추론 속도 향상 및 다양한 모델 지원을 제공한다.

1년 이상의 개발 끝에 ExLlamaV3 v1.0.0 정식 버전이 출시되었습니다. 이번 업데이트는 추론 성능 최적화와 의존성 제거에 중점을 두었습니다.

주요 업데이트 사항:

  • 의존성 제거: Flash-attention-2 및 xformers 의존성을 제거하여 설치 및 실행 환경을 간소화했습니다.
  • 성능 최적화: 새로운 Attention 커널을 통해 KV 양자화(KV quantization) 시 발생하는 속도 저하 문제를 해결하고 오히려 추론 속도를 향상시켰습니다. 또한 Ampere 아키텍처에서 GEMM/GEMV 성능이 크게 개선되었습니다.
  • 모델 지원 확대: Gemma 4를 포함한 대부분의 모델에 대해 Tensor-parallel 지원을 확장했으며, MoE 커널 스케줄러 및 새로운 Conv1d 커널을 추가했습니다.
  • 기타 개선: INT8 GEMV 커널 신규 추가, GptOssForCausalLM 및 NemotronHForCausalLM 지원, 그리고 다양한 버그 수정 및 품질 개선(QoL)이 이루어졌습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.