AI Briefing

Hugging Face, Block Sparse 라이브러리 공개

Block Sparse Matrices for Smaller and Faster Language Models

·2020.09.10 09:00

Hugging Face가 모델 크기를 줄이고 속도를 높이는 pytorch_block_sparse 라이브러리를 출시했다.

Hugging Face는 PyTorch의 비효율적인 sparse algebra 계산 문제를 해결하기 위해 pytorch_block_sparse 확장을 출시했다. 이 라이브러리는 모델의 크기를 줄이고 추론 속도를 높여 저비용 프로덕션 환경 구축을 지원하는 것을 목표로 한다.

NVIDIA CUTLASS를 기반으로 한 이 확장은 C++ CUDA 템플릿을 사용하여 고성능 블록 희소 행렬 곱셈을 구현했다. 사용자는 BlockSparseLinear를 통해 기존 torch.nn.Linear를 쉽게 대체할 수 있으며, BlockSparseModelPatcher를 사용하면 기존 모델의 소스 코드 수정 없이도 즉시 희소 모델로 변환할 수 있다.

주요 성능 및 특징:

  • 효율성: 75% 희소성(sparsity) 적용 시, 메모리 사용량은 4배 감소하며 연산 속도는 dense 모델 대비 약 2배 향상된다.
  • 결합 가능성: 증류(distillation) 및 양자화(quantization) 기술과 결합하여 모델 최적화 효과를 극대화할 수 있다.
  • 향후 계획: NVIDIA Ampere Tensor Core 최적화 및 학습 과정에서 최적의 희소 패턴을 찾는 도구 개발을 목표로 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.