AI Briefing

HF 엔드포인트 기반 ASR 및 화자 분리

Powerful ASR + diarization + speculative decoding with Hugging Face Inference Endpoints

·2024.05.01 09:00

Hugging Face Inference Endpoints에서 Whisper와 Pyannote를 결합하여 화자 분리 및 추측적 디코딩을 지원하는 커스텀 핸들러 구현법을 소개한다.

Hugging Face의 Inference Endpoints를 사용하여 Whisper(ASR)와 Pyannote(화자 분리)를 결합한 고성능 파이프라인을 구축하는 방법을 다룬다. 단일 API 엔드포인트에서 여러 모델을 동시에 실행하기 위해 **커스텀 인퍼런스 핸들러(custom inference handler)**를 활용한다.

주요 구현 사항은 다음과 같다:

  • ASR 및 화자 분리 통합: Whisper로 음성을 인식하고 Pyannote 모델로 화자를 식별하는 파이프라인을 구축한다.
  • 추측적 디코딩(Speculative Decoding): Distil-Whisper와 같은 경량 모델을 어시스턴트 모델로 사용하여 추론 속도를 가속화한다.
  • 최적화 기술: PyTorch 2.2의 SDPA를 통해 Flash Attention 2를 활용하여 성능을 높였다.
  • 모듈화: 핸들러, 유틸리티, 설정 파일을 분리하여 복잡한 로직을 체계적으로 관리한다.

이 방식은 복잡한 음성 처리 기능을 단일 엔드포인트로 배포하려는 개발자에게 유용한 모델 서빙 전략을 제시한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.