Hugging Face, 초고속 Whisper 엔드포인트
Blazingly fast whisper transcriptions with Inference Endpoints
·2025.05.13 09:00
Hugging Face가 vLLM을 활용해 Whisper 전사 성능을 최대 8배 향상시킨 Inference Endpoints 옵션을 출시했다.
Hugging Face가 Inference Endpoints에 OpenAI Whisper의 새로운 배포 옵션을 도입했다. 이 옵션은 vLLM 프로젝트를 기반으로 하며, NVIDIA Ada Lovelace(L4, L40s 등) 아키텍처 GPU에 최적화되어 있다.
주요 기술적 최적화 사항은 다음과 같다:
- PyTorch compilation (
torch.compile): 커널 최적화 및 연산 그래프 수정 - CUDA graphs: GPU 스케줄링 오버헤드 및 데이터 이동 감소
- float8 KV cache 양자화: 메모리 요구량 감소 및 캐시 적중률 향상
벤치마크 결과, Whisper Large V3 모델 기준 이전 버전 대비 RTFx(Real-Time Factor)가 최대 8배 향상되었다. 단어 오류율(WER)은 기존 Transformer 기반 모델과 유사한 수준을 유지하여, 품질 저하 없이 빠른 전사가 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.