AI Briefing
추천

CPU 전용 실시간 자막 도구 공개

hayamimi: GPU와 클라우드 없이 CPU만으로 실시간 다국어 자막을 만드는 음성 인식 도구

·2026.09.07 12:30

핵심 내용

GPU 의존성 없이 CPU만으로 실시간 다국어 자막을 생성하는 오픈소스 도구 hayamimi가 공개됐다.

1 / 2

자세히 보기

GPU나 클라우드 API 비용 없이 CPU 환경에서 실시간 다국어 자막을 생성하는 오픈소스 프로젝트 hayamimi가 공개됐다. 이 도구는 단일 대형 모델 대신 발화마다 언어를 판별해 해당 언어 전용 모델로 라우팅하는 방식을 채택해 CPU에서의 실시간 처리 지연 문제를 해결했다.

핵심 기술 및 성능

모든 모델은 INT8 양자화되어 ONNX 형식으로 실행되며, PyTorch나 GPU가 필요 없는 sherpa-onnx 런타임을 사용한다. 벤치마크 결과(RTX 3090 기준 비교가 아닌 CPU 기준) Ryzen 5 5600X CPU에서 Whisper Large v3 Turbo 대비 **RTF(Real-Time Factor)**가 0.07~0.10 수준으로, 실시간 처리(1.0 미만)를 안정적으로 수행한다. 정확도는 언어별로 WER/CER 2.3%~8.1% 수준을 기록하며, 특히 광둥어에서 기존 모델 대비 높은 정확도를 보였다.

주요 기능 및 구성

  • 언어별 전용 모델: 한국어(Paraformer), 영어(NVIDIA Parakeet), 일본어(ReazonSpeech) 등 최적화된 모델을 언어 감지 후 로드한다.
  • Two-pass 처리: 발화 종료 후 약 100ms 뒤에 확정 자막을 표시하며, 무음 구간이 감지되면 전체 문맥을 고려해 재추론하여 정확도를 높인다.
  • 화자 분리 및 번역: DAMO Academy의 3D-Speaker 임베딩을 활용해 화자를 라벨링하고, Fugu 및 M2M-100 모델을 통해 실시간 번역을 지원한다.
  • 설치 및 사용: pip install hayamimi로 설치 가능하며, FFmpeg와 Python 3.10 이상 환경에서 실행된다. 기본 모델 다운로드 용량은 약 3.1GB이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.